阅读,与值得关注的内容Readance

全网刷屏的 Jev 新模型到底是个啥?一次性讲透架构、原理、实测、争议

大家好,我是玄姐。

PS:

AITutor 来了。每个人的 AI 原生学习伙伴,全网首发,点击预约。

这周 AI 圈最火的名字,不是哪个新的聊天模型,而是一个叫 Jev 的"怪胎":它不会聊天、不会写代码、不会写文章,只会做判断
发布它的 TypeSafe AI 在 9 月 16 日正式亮相,创始人 Diogo Almeida 是 RLHF 之父、ChatGPT 核心贡献者之一,官宣帖子浏览量已经冲到 3800 多万,公司手握 4000 万美元种子轮融资。有人用它打马里奥、玩 Minecraft、给 Agent 当裁判,也有人嗤之以鼻:不就是个 JSON 分类器吗,值得这么吹?
今天给大家一次性讲透。
先说三个结论:
  • Jev 不是聊天模型的替代品,它是软件内部的"决策原语",专门干分类、路由、打分、校验这类高频小判断。
  • 它快 20 到 200 倍、便宜 40 到 400 倍,代价是彻底放弃文本生成能力,输出只有三种强类型答案。
  • 它的正确打开方式是"有限解空间、高实时要求、结构化输出"。放错位置就是事故放大器,放对位置就是成本粉碎机。
下面按"是什么、凭什么快、怎么用、实测数据、争议边界、落地建议"六个部分展开,全程干货。

PS:

Jev 模型更多案例深入免费学习去这里:

图片
1.打开 AITutor 新一代 AI 原生学习伙伴:www.aiaitutor.com 2.在首页输入"Jev” 就能看到更详细更丰富案例。3.包含了图文、视频、播客、闪卡、代码、测验等9种学习模态。

一、Jev 是个啥:一个不写字的"裁判"模型

诺贝尔经济学奖得主卡尼曼在《思考,快与慢》里有个经典理论:人脑有两套系统,System 1 负责不费力的直觉式快判断,System 2 负责缓慢的深度推理。
过去所有的主流大模型,GPT、Claude、DeepSeek,全是 System 2 路线:逐 token 推演、组织语言、生成答案。能力强,但慢、贵、输出不可控。
Jev 自称首个公开的 System One 模型。它模拟的就是人脑那种下意识的毫秒级本能判断。Diogo 的原话里有一句很扎心:为什么超人般的聊天模型没有催生出 AGI?他的答案是,因为软件的绝大部分时间在做小判断,路由这张工单、标记那句话、给这条日志打分,而这些判断不该由一个"作家"来做,该由一个"裁判"来做。
一句话概括:Jev 就是一个聪明的 if 语句。
普通代码根据可计算的值来分支,比如 if (order.total > 100)。可一旦条件变成一种"判断",这套做法就失灵了:这条客服消息是在发火吗?这封邮件是关于账单的吗?这 12 个按钮里该点哪一个?Jev 干的就是这件事:你给它一段 state(状态数据)和一组带类型的问题,它返回每个问题的概率化答案,然后你的代码接管后续动作。
把 Flavio Copes 整理的对比表直接搬过来,一看就懂:

工具

你给它什么

它返回什么

它的角色

ChatGPT

提示词或一段对话

生成的响应

通用助手

Cursor

编码任务、仓库和工具

文件编辑、命令、测试结果

编辑器与编码智能体

Codex / Claude Code

编码目标、项目和工具

代码变更与已完成的任务

编码智能体

Jev

state 加答案形状已定义的问题

选项、分数和概率

软件内部的决策原语

注意,Jev 不是来取代这些工具的,是来嵌进去的。编码智能体跑 shell 命令之前问它一句"这条命令是只读、可逆还是破坏性",客服系统拿它判断消息该查数据库、走 LLM 还是转人工。产品不必变成聊天机器人,工作流也不必变成智能体,在普通 if 语句读不懂语义的地方,加一次模型调用就够了。

二、凭啥又快又便宜:并行采样加 RLCD

这部分是硬核干货,拆成三点讲。

1. 架构:彻底抛弃自回归生成

传统 LLM 慢的根源是自回归架构,一个 token 一个 token 往外蹦。你想让它返回一个 {"category": "billing"},它也得按顺序把每个字符解码出来,中间还可能生成失败或者编出一个不存在的字段。
Jev 完全不这么干。它做单次前向传递,同一请求里的所有问题基于同一个 state 并行评估,输出直接是你预定义选项之上的概率分布。答案在结构上不可能落在 schema 之外,官方把这个标为 0% 类型错误率,注意这是结构保证,不是经验统计。从此"schema 错误"和"决策错误"成了两个相互独立的问题,前者被消灭,后者靠阈值治理。
有个评论很传神:用并行计算取代顺序计算,正是当年 Transformer 超越 RNN 的方式。

2. 训练:RLCD 替代 RLHF,输出"认知内的概率"

这是最有故事性的一点。Diogo 本人就是 RLHF 的核心发明人,当年这套方法让 GPT 3 学会对齐人类偏好,催生了 ChatGPT。但他公开反思了 RLHF 的工程缺陷:奖励"人类爱看的答案",导致模型不懂装懂、过度自信、产生幻觉。后来的 RLVR 走可验证奖励路线,把模型推向 o1、R1 那种深度推理,但对和错的代价是又慢又贵。
海量企业自动化业务要的不是长篇大论,是毫秒级响应加高准确度。于是有了 RLCD(校准决策强化学习),优化目标是与真实结果相符的概率。所谓校准,就是在大量预测中,被赋予 90% 概率的那些答案,应该有大约 90% 的时间是对的。有几成把握说几成把握,绝不瞎编。
这种"诚实的概率"价值巨大:工程师可以直接写 if decision.confidence > 0.88: 自动执行,否则转人工,人机协同第一次有了可以放心依赖的数值基础。

3. 数字:快 193 倍,便宜 444 倍(当上限看)

官方给出的端到端响应是 70 到 500 毫秒,大多数调用在 100 毫秒上下;同任务前沿 LLM 要 3 到 329 秒。价格是每百万输入 token 0.042 美元,输出免费。官方自己的招牌数字是"快 193.6 倍、便宜 444.6 倍",但它自己也承认这来自偏高端的工作流评估,建议大家当上限看。
横向对比一下:当红旗舰模型(GPT 6 Astra、Claude Fable 5.1 这个级别)输入普遍 10 美元每百万 token,输出 50 美元。单看输入,Jev 便宜 238 倍;算上它完全免费的输出,在真实分类路由场景里综合成本能便宜近千倍。
对了,Jev 这个名字致敬的是杰文斯悖论(Jevons Paradox):蒸汽机效率提升后,煤的总消耗不降反升,因为更廉价的动力创造了新用途。TypeSafe 赌的就是智能遵循同一条曲线,当一次决策的成本远低于一美分,你会把决策塞进那些永远不会调用 LLM 的角落。

三、怎么用:三种原语加一套工程纪律

你向 Jev 提出的一切问题,都只有三种原语:

类型

对应的问题

返回什么

Noul

这是真的吗

0 到 1 的概率

Choice

这些选项中的哪一个

选中项、完整概率分布、置信度

Score

在这个刻度的什么位置

加权分数、各等级概率、置信度

调用方式极简,POST 一个请求到 /v1/systemone,带上 state 和 questions 就行。SDK 有 Node 的 @typesafe-ai/sdk 和 Python 的 typesafe-sdk,Vercel AI SDK 首日就原生支持了 experimental_evaluate,OpenRouter 也同步上线。生态第一天就是满的
比 API 更重要的是工程纪律,提炼五条:

1. 一次问完所有问题(推测性扇出)同一请求里的问题并行评估,每个额外问题只消耗自己的 token。官方 cookbook 实测:13 个问题打包进一次调用,比 13 次顺序调用便宜 12.2 倍、快 10 倍。哪怕某个答案只对部分输入有意义,也一并问出来,由代码决定取用哪些。

2. 组合评分,权重握在自己手里。一个判断依赖多重因素时,别问一个大问题,每件事各问一个 Score,再用自己的系数加权。比如工单优先级等于 0.6 乘严重度加 0.3 乘客户情绪加 0.1 乘报告质量。排序结果不符合团队直觉时,改一个系数就行,不用重写提示词。

3. 置信度三段治理。高置信度自动执行,中置信度请用户确认,低置信度转人工。文档给的示例值是 0.5 作为人工复核下限、0.9 作为破坏性操作门槛,但提醒:这些是示例值不是默认值,先拿自己的标注数据跑出置信度和准确率的对应关系,再定阈值。

4. state 里只放问题需要的内容。塞满无关内容准确率会下降,这模型一样会"上下文腐化",过滤要做在你的代码侧。

5. 提问纪律。每个问题只求一个判断;criteria 里描述情境而非程度(写"功能损坏但有变通方案",别写"中等严重");覆盖不全就加 other 选项给模型留退路;数字、日期、计数一律留在代码里算,它不擅长。

四、实测数据说话:两组真刀真枪的对测

光听官方吹没用,给大家上两组第三方实测。

1. 祝威廉:苹果十年年报召回判定对测

祝威廉老师拿 Apple 的 10-K 年报(FY2016 到 FY2025,SEC EDGAR 原文,20 份文档)当语料,设计了 25 个按年份锚定的中英混合问题,构造 79 个样本对,其中 52 个是专门考"看着像但其实不是"的相邻年份 hard negative,正面对刚生产环境在用的 DeepSeek V4.1 Flash。结果:

指标

Baseline LLM

Jev

对 expected 的准确率

92.2%

92.2%

Gold 保留(共 25)

24

25

平均时延

11.3 秒

1.0 秒

单次判定成本

约 $0.0006 到 0.001

约 $0.000177

准确率打平,速度快 11 倍,成本便宜 3.5 到 5.6 倍。两个判定器决策一致率 94.7%,仅有的 4 个分歧双方各赢 2 个,没有系统性偏差。两个细节很有意思:一是两边各错的 2 次都是超时而非误判;二是 Jev 的输入 token 反而更多(33.3 万对 28.1 万),总价却更低,因为它一次前向只出概率分布,没有 reasoning 输出这条计费线。祝老师的结论是:在知识库召回判定这种高频调用场景,成本与时延就是产品体验本身。

2. LangChain 官方:Jev-as-a-Judge 智能体评测

LangChain 团队用 Deep Agents 搭了个天气智能体,拿 LangSmith 数据集做 100 次重复评测,对比 GPT 5.6 Luna、GPT 5.6 Terra 和 Claude Sonnet 4.6:

裁判

与人工基准一致率

质量评分方差(相对 Jev)

单次成本

平均时延

Jev

100%(500 次全对)

1 倍

$0.00035

0.44 秒

GPT 5.6 Terra

99.8%

高 913 倍

$0.00289

2.83 秒

GPT 5.6 Luna

96.4%

高 433 倍

$0.00039

2.50 秒

Claude Sonnet 4.6

80.0%

高 92 倍

$0.02811

2.16 秒

总账更夸张:整个评测 Jev 花了 0.34 美元,Claude 花了 28.17 美元。2我觉得这组数据的意义在于:当评估器又便宜又稳,团队就敢在更大比例的生产轨迹上跑评判,Agent 系统的反馈信号密度直接上一个台阶。这可能就是智能体评估的第三种形态,前两种是基于代码的评估和 LLM 裁判。

五、争议与边界:是真创新,还是高级 if-else?

全网夸完之后,必须给大家泼点冷水,这部分同样重要。
争议一:它是不是就是个 smarter 的 if-else?知乎答主赵泠的观点很犀利:这不算下一代 AI 新模型,能力边界从一开始就被框死,不具备自由文本生成能力。所谓"无幻觉"是重新定义了幻觉这个词,它只是不会输出你定义之外的内容,这叫格式正确,不代表不会判断错误。而且已经有人花 2 小时基于 Qwen 2.5 1B 复刻出类似产品,技术护城河存疑。说到底,它的核心竞争力从来不是"更准",而是"更快、更便宜、够用就行"。
争议二:它不会"指哪打哪"。小马智行架构师程墨做了个自动驾驶思想实验:200 迈车速,左边车道一只狗,右边车道一位女士。设定"安全第一"时 Jev 选急刹,概率 94%;改成"到达优先"后依然选急刹,概率降到 77%;干脆让它别管安全,急刹概率反而回升到 80%。这说明它有自己的"默认规则",会先理解所有规则再做选择,依然带着大模型的老毛病。
争议三:放错位置就是事故。Monad 团队的开发者拿它做高频交易判断,把策略简化成"涨还是跌"的判断题,结果在诱空诱多、假盘口丛生的对抗市场里被反复带偏,杠杆放大回撤。越把 Jev 往"全权决策"的位置上放,速度越是亏钱的放大器。
边界实测Browser Use 创始人做了长程浏览器交互测试,20 道题只对 1 道;有人尝试用它重写 Pi Agent 的模块,发现核心环节根本无法替代,只能接数据分类、文本压缩这类边界清晰的子任务。
官方自己发布的"参差性"页面也坦白了一批失灵场景,列出来:数数算术不行(十六进制颜色它分不清相近不相近);日期时间比较不可靠;双重否定和间接引用会掉准确率;臃肿的 state 会掉准确率;state 会被操纵性文本带偏(提示词注入对它有效);Score 不是测量仪,1.4 分不能解读成"40% 的愤怒";最后,它不会写作,理论上能用链式 Choice 逐字符逼它吐文本,但又慢又差。
总结一句:用 Jev,你是让它从牌堆里挑一张牌,不是让它凭空报出一张牌。每当直觉告诉你"让模型抽取出某个值",正确做法是改写成"这里是几个候选,是哪一个"

六、生态与落地:大家已经拿它干了啥

发布不到一周,社区的玩法已经炸开。挑几个有代表性的:
  • pg-jev:PostgreSQL 扩展,用自然语言判断过滤行或评估相关性,SQL 本身还是 SQL 跑。
  • Sponsor Skip:识别 YouTube 转写文本里的口播赞助片段,扩展负责映射时间戳自动跳过。
  • Jev Ultrafast:浏览器自动化里,Jev 负责从页面可交互元素中选下一步点哪个,需要输入文字时另一个小 LLM 提供文本。有人用这套分工约 7 秒订好一张机票。
  • TypeSafe Mario / Jev Drone:读结构化游戏状态做操作决策,不看截图。
  • Fast Jev Compaction:Claude Code 插件,给工具调用结果打分,决定保留、丢弃还是截断上下文。
官方 Demo 更出圈:Minecraft 生存 Bot 几十毫秒一次决策,灵活走位躲僵尸;《地铁跑酷》毫秒级避障,角色在铁轨上行云流水;Doom Bot 每秒约十次查询,成本估算每小时 7 美元;Wikiracing 机器人每步在几百个链接里做选择,而且从不选中不存在的链接。
企业侧最值得抄作业的是这几种模式:智能体护栏(shell 命令执行前判定只读、可逆、不可逆,一次影子测试里一条含义不明的 rm -rf 以 0.33 的置信度被判不可逆,正是这个低置信度触发了人工介入);意图路由(订单查询完全不碰 LLM,产品问题带上下文进 LLM,投诉按情绪分数在 LLM 和人工之间取舍);语义 linter(先让 Jev 找出代码库里"该看哪里",再让编码模型动手改)。

七、判断与落地建议

最后说点我的看法。
Jev 的意义不在于它有多强,而在于它把"判断"变成了和存储、计算一样可编程、可计量、可组合的基础设施。天下苦 LLM"慢思考"久矣,它撕开了大模型"生成为王"的假象:很多真实业务场景需要的也许是一个又快又准的裁判,而不是一个滔滔不绝的作家。AI 行业卷了几年"通用大模型军备竞赛"之后,开始往"分工细化"走了,这个信号比 Jev 本身更值得重视。
判断,System 1 加 System 2 的组合架构大概率会成为 Agent 时代应用的标准形态:Jev 这类决策模型负责路由、校验、打分、刹车,LLM 负责理解、推理、生成,而真正掌握生杀大权的,永远是你自己的代码。
想上手的同学,建议走 Flavio 总结的影子模式六步走:
  • 保持现有行为不变;
  • 让 Jev 在旁边跑影子模式,记录完整答案;
  • 标注它的决策对错;
  • 用这批数据调整问题和阈值;
  • 先自动化低风险路径;
  • 不确定的情形继续交给人工或更强的模型。
从哪个场景开始?挑一个你的代码已经在硬编码、或者靠一条总是出错的正则在应付的平淡决策:路由、批准、跳过。先让它跑起来看一周日志,再谈自动化。
最后一句话送给大家:一个不花钱的 if,永远好过一次可能出错的模型调用。Jev 该去的地方,是普通 if 读不懂语义、而 LLM 又贵又慢的那些角落。
你觉得这种"决策模型"会先在哪个行业爆发?评论区聊聊。
参考:

送个福利:

新一代 AI 原生学习伙伴 AITutorwww.aiaitutor.com,重构学习方式AI 驱动个性化精准成长,体系化学习+真实案例,塑造 AI 实战能力。快来免费体验吧。

PS:AITutor 来了。每个人的 AI 原生学习伙伴,全网首发,点击预约。

八、加我微信

扫码加我👇有很多不方便公开发公众号的我会直接分享在朋友圈,欢迎你扫码加我个人微信来看👇

图片

加星标★,不错过每一次更新!

⬇戳”阅读原文“,立即体验 AITutor

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →