阅读,与值得关注的内容Readance

最近的Jev决策模型何为?技术本质、开源项目及效果如何评估

今天是2026年9月22日,星期二,北京,天气晴。

继续看技术,最近jev项目很火。TypeSafeAI(前OpenAI研究员DiogoAlmeida)2026-09-15/16发布的"SystemOne"决策模型,不生成文本,直接输出Choice/Score/Noul三类带概率判定。但是,权重未公开、参数规模未披露、架构与RLCD(ReinforcementLearningforCalibratedDecisions,校准决策强化学习)训练配方仅概要描述,仅经API(POST/v1/systemone)提供。

来谈谈,同步看下昨日的今天的技术进展早报。

从决策实现上看,这个决策,细分三个决策原语(核心接口):

Choice:从有限候选中做分类选择,附带各选项概率与置信度;

Score:对有序rubric打分,返回连续分数与分布;

Noul:校准的布尔概率P(true),用于是非判断。

从定位上看,Jev是把Agent运行中最频繁的高频、原子化、边界明确的判断(分类/选择/评分/真伪)从"慢思考大模型"里剥离出来,用一次前向传播+logits直接打分完成。它验证的是Agent的"快慢分工"(Harness架构),而非文本生成能力,不要去神话它,能不能用,去测试它。

记住,它是一个特定任务的模型,场景很受限,不是大一统模型。不要跟风,其实现在很多都是那种对比法。拿A的强项跟B的弱项去比。但是B比A更全面。这套叙事逻辑还在走着。

这个具体究竟如何,可以展开来看:

一、关于jev模型的一些认识

说jev为啥火,从目标域的角度上去说,有张图很有意思,jev或的一个原因是,是llm用来分类的请求就占10%,所以这个兴许是这个口子

但是,关于jev模型热潮,这个,其实还是要回到具体的业务域上。

在无法解决确定性的场景面前:快没有太大的意义,省钱也没太大的意义,jev只是一个零样本条件下的排序/分类模型,还是概率【不确定性】。本质上还是猜【单单地猜的更快、更准些】,0-1而非0/1【不保真】

这里也可以形成进一步的判断:适用边界—高频、低复杂度、语义判断、结果可被程序消费的场景是它的主场;凡是需要"算"(数值)、需要"解释为什么"(审计/医疗/放款)、选项无法穷举的场景,它都不是最终答案,只能当流水线里最便宜的一环,且必须有门槛和人工兜底。

根本上的,从技术发展上看,jev这种方式反而是一种倒退。因为生成式的llm,目的就是为了大一统【判别/生成】。jev是在范式上开历史倒车【有为了多快好省而开倒车(此处略有武断)】

jev的使用其实跟之前的lora路由的实用性是一回事儿,后续不会变成主流叙事,而是会变成Agent等部分场景的一个组件级,单独无法成事。大一统始终是主流趋势,端到端才符合算法直觉。

##二、关于Jev的一些开源项目

虽然它不开源,但是,也陆陆续续出现了很多不同的开源复刻(本身jev不开源),上线约1周,社区已涌现28+个项目(https://github.com/OmniJev/awesome-jev-gallery)。它们复现的是"跳过自回归解码、隐状态直接打分、KV-Cache广播+词表切片、封闭决策空间消除幻觉"这一机制/接口,但没有一家复现RLCD训练方法。

基座生态以Qwen系列(0.8B–9B)、ModernBERT/DistilBERT、Gemma3、DiffusionGemma、LFM2.5为主。

其中值得看的是laya。【Jev开源复现项目】轻量AI决策模型项目,对标闭源的TypeSafeJev,专门处理不需要生成大段文本的快速判断任务:工单分类、内容风控、意图路由、选项判别、布尔判断、评分分级等场景。模型权重如下:

一个具体的使用例子,其实很简单:

项目地址在:https://github.com/NandhaKishorM/laya,

权重地址在:https://huggingface.co/convaiinnovations/laya

演示Demo地址在:https://huggingface.co/spaces/convaiinnovations/laya-demo

也有封装版本:https://github.com/jlt-commons/laya-jolt。

其余的,也有一些其他的项目,也可以看看:

一个是【Jev民间项目】,可以看看都用来干啥,一个非侵入式的实时对话理解与回复辅助层,挂在任意聊天窗口旁边,读懂对方在说什么,用TypeSafeJev判断模型给出「对方真实意图/危险等级/该不该马上回/最佳动作」,再用一个生成式模型起草3条候选回复并让Jev排序,最后以半透明悬浮窗展示,一键填入输入框,地址在https://github.com/Finderchangchang/jev-chat-JARVIS

一个是【Jev反例项目】,其中提到慎用Jev的场景:需要绕路,回溯,多步规划的:迷宫,装箱,调度等局部启发和全局最优不一致的图问题;突然死亡型控制:贪吃蛇,俄罗斯方块,自动驾驶等,一步踏错当场GG;不可逆高代价决策:删库,事务操作,尤其是需要审计的场景。https://github.com/karminski/Jev-Quantum

一个是【Jev应用案例】,有个案例集合,严格意义上是一个索引。Jev能做什么?60个案例。https://doc.laoyao.cn/j61zgy?mark_id=999_reallog_mark_ad%3A999%7CWeiboADNatural#library

三、JEV这列模型都是怎么评出来的?

关于这个点,其实可以讲讲这种jev类的效果评估【这个很关键,都说效果好,总得讲清楚怎么个好法】。

先看其评估方式。思路是:固定随机种子,同一轮运行里每个模型答逐字节相同的问题,对比公平;主结果跑在TeslaT4上,另有CPU上的51语言全量扫描;每个模型输出的是三类原语:choice(多选分类)、score(有序量表回归)、noul(二分类概率0-1)。

再看校准指标方面,用的是ECE、Brier、scoreMAE;还单独测了选项顺序鲁棒性(排列选项后答案变动的比例)。

终看评测benchmark,共覆盖三大类:

一类多语言意图/推理。包括:MASSIVE(多语言意图识别,核心多语言测试):亚马逊出品的多语言任务型对话数据集,基于SLURP/Covov2派生,覆盖51种语言的同一条意图/槽位标注。Laya用它测intent(识别用户意图)和scenario(技能场景)两类子任务,每题20个选项,随机基线只有0.050。

XNLI(多语言推理,15种语言),斯坦福XNLI,把MultiNLI翻成15种语言,任务是判断"前提→假设"的蕴含/矛盾/中性三类关系——衡量多语言语义理解而非单纯意图。

一类是typed-decisions专用测试集(主打场景),这是Laya自己构造的任务,400cases、2,000道决策题、四个工作流(发票处理、安全事件、客户服务、agent操作日志可观测性)。

一类是英文标准任务+应用工作流

包括:

英文标准任务:AGNews、BoolQ、DAIREmotion、SST-5(ordinal)、prompt-injections(n=116,偏小)

七个真实应用主题:邮件垃圾邮件、钓鱼、越狱检测(held-out)、内容审核(held-out)、RAG相关性、工单分流、模型路由

三个Jev有公开数字的榜单:AGNews、DAIREmotion、Banking77(77标签),其中,银行客服意图分类77个意图类,是公开榜上类数最多的测试。

所以,再判断jev是否真的有用的时候,应该自己去做测试。

关于我们

老刘,主页:https://liuhuanyong.github.io。

对知识图谱本体论、Agent记忆及架构、RAG知识库等技术方向感兴趣,欢迎加入社区,社区持续纳新。

加入社区方式:关注公众号,在后台菜单栏中点击会员社区加入。


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →