阅读,与值得关注的内容Readance

Jev才火一周,13篇论文光速上线!网友:公式做题就是快

图片

你还在赶 ICLR 截稿,Jev 相关论文已经在 arXiv 上排起了队。


9 月中旬,几乎所有人都在忙着赶 ICLR 截稿。


Jev 却在这时候突然刷屏。9 月 15 日,TypeSafe 正式发布 Jev。


4 天后,第一批相关论文已经挂上 arXiv。接下来的几天里,数量很快涨到 13 篇,其中 9 月 21 日一天就上线了 6 篇。




最早的一批工作,主要测试 Jev 能不能替掉原本由 LLM 完成的决策环节。


没过几天,研究范围已经扩展到 Agent 记忆、Judge 和视觉任务。2B 开源模型和独立横评也很快出现,还有人专门测试 Jev 在什么情况下会判断失灵。


TypeSafe 给 Jev 的定位很明确。它不负责开放式文本生成,主要处理答案范围已经明确的决策任务。模型直接给出结构化结果和对应概率,不需要先生成一段回答,再从里面解析答案。


支持者认为,很多 agent 调用最后只需要返回 Yes/No,或者在几个候选项里做选择,没有必要每次都走完整的生成流程。


质疑者则认为,这类能力并不新鲜,传统分类模型早就在处理类似的有限决策任务。


两边还在争,相关论文已经先上线了。



Jev的第一批应用

第一批论文关注的,大多是原本可以交给生成式 LLM 处理、最终却只需要返回几个固定字段或有限选项的任务。





论文标题:

Replacing Large Language Models with Jev Decision Models for Low-Latency Edge Service Orchestration

论文地址:

https://arxiv.org/abs/2609.22753


研究团队把 Jev 用在边缘服务编排中,根据自然语言请求判断服务类型、执行位置限制、质量等级和紧急程度。


实验中,Jev 的中位决策延迟比使用结构化输出的 DeepSeek 低 15.9%—26.5%;无缓存时,成功完成一次任务的 API 成本降低约七成。



〓 Jev 与 DeepSeek 的决策延迟对比



论文标题:

Fast Intent-Driven Service Orchestration with Jev for 6G Edge Networks

论文地址:

https://arxiv.org/abs/2609.23136


这篇文章的研究场景是 6G 边缘网络中的服务编排。Jev 根据自然语言意图生成执行位置限制、截止时间和优先级等服务约束,再交给后续调度器处理。


论文将其与 DeepSeek、Gemini 和自托管 Qwen 进行了比较,Jev 的优势主要集中在决策延迟。



〓 Jev 驱动的 6G 服务编排框架


论文标题:

Calibrated Decisions at Scale: Converting Police Crash Narratives into Probabilistic Crash Variables with a System One Model (Jev)

论文地址:

https://arxiv.org/abs/2609.24052

GitHub地址:

https://github.com/pozapas/jev-calibrated-narrative-coding


研究者用 Jev 批量处理德州交通事故叙述。第一阶段筛查约 49.95 万条记录,第二阶段再用完整的 27 个问题对约 19.59 万条记录进行结构化编码。


模型返回的概率还被用来筛选需要人工复核的样本。



〓 交通事故叙述的规模化编码流程


论文标题:

Jev for Scientific Decisions: Evaluating Semantic Choices and Their Consequences

论文地址:

https://arxiv.org/abs/2609.24965


这项研究把 Jev 放进科学计算流程。模型从已有证据中选择语义关系,计数、筛选和公式计算仍由程序完成。


研究者分别检查语义选择、下游计算结果和最终标签,避免最终标签碰巧正确,反而掩盖前面的判断错误。



〓 Jev 接入科学决策工作流


Jev-Anything

有网友开玩笑说,一个新概念火起来,后面很快就会出现各种“XX + 新概念”。








论文标题:

Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents

论文地址:

https://arxiv.org/abs/2609.23986

GitHub地址:

https://github.com/libingzheren/Jev-Mem


Jev-Mem 把 Jev 用在 Agent 记忆系统里,负责记忆分类、检索预算、查询路由和停止条件等判断,复杂推理和最终回答仍交给 LLM。


在 LoCoMo 上,系统的记忆构建时间降到 158 秒,相比最快对照系统加速 6.6 倍。



〓 Jev-Mem 整体架构


论文标题:

REFLEX with Jev for Efficient Selective Control in LLM Agents

论文地址:

https://arxiv.org/abs/2609.26532


REFLEX 把 Jev 放在 Agent 的决策层。置信度足够高时直接执行有限决策,置信度不足或需要开放式生成时,再调用更强的 LLM。


在预先固定的 100 个任务中,系统保持 95% 的成功率,同时减少了 72.7% 的强模型调用。不过在外部评测中,相比低成本生成模型的级联方案,它的优势并不稳定。



〓 REFLEX 的选择性控制架构


论文标题:

JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

论文地址:

https://arxiv.org/abs/2609.26550


JEV-as-a-Judge 直接把 Jev 用作 Judge。


研究者将 JEV 与 16 种生成式 Judge 和奖励模型进行比较。在常规偏好判断和有证据支撑的事实判断上,JEV 与最强对照模型的差距不到 3 个百分点。


低置信度样本则继续交给更强的 Judge 处理。遇到需要检查推导过程,或表面上很有说服力但实际错误的回答时,差距会明显扩大。



〓 不同 Judge 评估接口对比


论文标题:

Open-Jev Judgments on CallScreenBench: Calibrated One-Pass Scam Screening with a Small Language Model

论文地址:

https://arxiv.org/abs/2609.23959


研究者基于 Qwen3-4B 微调出 JevLite,通过一次前向传播直接读出诈骗电话概率。


测试中,单次判断耗时约 64.5 ms,相比使用同一底座模型生成答案快 4.9 倍。论文也明确说明,这项工作的重点是应用和评测,并没有提出新的模型架构。



〓 生成式分类与 JevLite 单次决策对比


论文标题:

JEVQA — Video Quality from Metadata, Bitstream, and Pixel Features with a General-Purpose Decision Model

论文地址:

https://arxiv.org/abs/2609.24395


JEVQA 用 Jev 做零样本视频质量预测。


只输入编码元数据时,JEVQA 的表现已经接近标准化 P.1204.1。加入码流和像素特征后,相关性进一步提升。使用相同特征专门训练的视频质量模型仍然表现更好。



〓 JEVQA 视频质量预测结果


论文标题:

Visual Jev: Accurate and Efficient Decisions from Shared Visual Context

论文地址:

https://arxiv.org/abs/2609.25845

GitHub地址:

https://github.com/guanxuyu-sv/Visual-Jev


Visual Jev 处理的是一张图片对应多个结构化问题的场景。


图片只编码一次,后面的多个问题共享同一份视觉上下文。每张图对应 32 个问题时,相比逐个执行快 8.9 倍。相比仍会重复计算视觉前缀的批处理方案,也快了 3.4 倍。



〓 Visual Jev 的共享视觉上下文设计

开源平替与挑错

应用之外,围绕 Jev 的开源实现和外部评测也已经出现。





论文标题:

this-that-model-1.0: A typed decision model that decides in 30 ms, for a millionth of a cent

论文地址:

https://arxiv.org/abs/2609.23886

GitHub地址:

https://github.com/FLock-io/this-that-model


this-that-model-1.0 是一个约 2B 参数的开源类型化决策模型,可以在消费级 GPU 上本地运行,论文测得单次判断约 30.9 ms。


在第三方记录的 68 道决策题上,它的准确率为 0.941,对应 Jev 为 0.765。到了需要多步计算的任务,得分降到 0.560。



〓 不同决策模型的准确率与成本对比


论文标题:

Evaluating Decision Models for Text Annotation in Computational Social Science

论文地址:

https://arxiv.org/abs/2609.24574

GitHub地址:

https://github.com/hazemibrahim97/decision-models-css


这项横评覆盖 18 个计算社会科学分类任务,共 7,977 条样本,同时比较了 Jev、两个开放权重决策模型和 19 个 LLM。


在 15 个正式评测任务中,Jev 有 14 个落后于单任务表现最好的 LLM,中位差距为 11.6 个 macro-F1 点。


每项任务上表现最好的 LLM,实测成本中位数约为 Jev 的 44 倍。研究者还测试了混合方案,让 Jev 处理高置信度样本,再把剩余部分交给 LLM。



〓 决策模型与 LLM 的准确率和成本对比


论文标题:

Type-Safe Is Not Error-Free: A Constrained Decision Head Follows the Option Name, Not the Rubric Bound to It

论文地址:

https://arxiv.org/abs/2609.26758


这篇论文专门测试类型化决策模型对选项名称的敏感性。


研究者保持问题、输入状态和选项定义不变,只交换选项名称与定义之间的对应关系。


在 Jev-like 模型上,使用 no/yes 这类带明显语义倾向的选项名时,这种交换会造成大面积判断反转,AUROC 从约 0.94 降到 0.23;换成 0/1、A/B 等中性名称,同样的操作影响很小。


TypeSafe 提供的 Jev 服务中也观察到了同类现象,不过幅度较小。整个实验过程中,所有模型的类型错误率始终为 0%。



〓 选项名称变化带来的决策反转


Type-safe 能保证返回值符合预先规定的类型,并不能保证模型每次都按选项背后的定义做判断。



结语

Jev 会不会成为一个长期存在的独立模型类别,现在还很难判断。


TypeSafe 目前公开的模型架构和训练细节仍然有限,已经出现的外部评测也没有给出一个统一答案。


有些任务上,它的速度和成本优势比较明显。换到文本标注等任务,生成式 LLM 的准确率依然更高。


但只过了一周,围绕 Jev 的研究已经远不只是应用验证。


难怪有人把这种节奏叫作「公式做题」。


段子还没讲完,论文已经挂上 arXiv 了。


更多阅读




·


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →