最近研究 Jev【文献1】,有一些初步判断/推测,
Jev 的最大秘密可能是重新定义了模型学习什么、输出什么。
传统 LLM 学习的是
输入状态,生成文字。
Jev 更接近
输入状态、问题和答案类型,直接输出决策及概率。
系统1决策
假设判断一个客户是否存在流失风险。
传统 LLM “根据客户最近的交易行为,我认为其流失风险较高……”,
程序还得从文字中解析答案。
Jev 可以直接返回
low 0.08
medium 0.27
high 0.65这种模型被称为系统1决策:
输入非结构化 state,输出类型概率决策。Choice、Score、Noul 是基本决策原语。
模型直接提供代码可以用的决策分布。
原子判断
复杂业务通常包含多个判断。Jev 把它们拆开
Q1:是否存在流失风险?
Q2:风险有多高?
Q3:客户价值属于哪个等级?
Q4:是否需要人工介入?然后
TypeSafe明确强调Jev处理原子判断,后续代码负责组合和执行。
笔者曾猜测“IFTTT被训练进了Jev模型”,现在感觉不像。
用户自己的数据、规则和知识通过状态、指令、准则在运行时提供,不微调用户专属模型权重。
训练什么
TypeSafe 已经公开,Jev 使用 100% 合成数据训练。
创始人 Diogo Almeida 还表示,他们大量研究如何生成具有普适性的合成数据,将目标描述为类似一个认知核。
所以 Jev 训练形式可能是
也就是大量合成的决策。
比如
State:客户交易、行为、历史……
Question:未来30天是否可能流失?
Structure:low / medium / high
Outcome:high不学行业的具体规则,学更一般的能力,
给定一个状态、一个问题和一个决策空间,如何形成概率判断。
所谓认知核就是学到这个决策算子。
不过,以上都是推测。
TypeSafe 应该不会公开合成数据的具体生成机制,这是他们的核心机密。
RLCD
Jev 的另一核心技术是 RLCD(Reinforcement Learning for Calibrated Decisions)。
传统分类只需要
Jev 需要保留完整的概率
因为概率本身就是程序决策的一部分。
如果模型给出 0.8,意思是长期来看,这类事件应该大约 80% 会发生。
所以 Jev 追求的不只是“答对”,还要可信。
官方将 RLCD 定义为训练模型输出校准的决策和概率,不生成文本。
Type处理
普通 classifier
类别通常固定。
Jev 可以在运行时定义
Choice:
approve / hold / reject也可以
Choice:
approve / hold / reject / manual_reviewJev 还明确支持 JSON schema、taxonomy、database row 等结构化输入,强调模型被训练来理解结构。
所以可能更合理的理解是
Type 不仅输出格式,还可能参与决定模型面对的决策空间。
并行采样
笔者最初的判断
“采样推理并行化”,现在已经得到相当强的支持,
Jev 明确提出并行采样器 parallel sampler。
传统 LLM 是
Jev 可以把多个独立问题放进一次调用,并行得到结果。
“选举最佳答案”交给了代码,
并行产生概率分布,再由代码完成选择、阈值判断、路由或人工升级。
核心抽象
Jev 可以浓缩成,
合成决策语料 - 通用认知表征 - RLCD - 类型决策分布 - 并行采样器 - 代码 - 行动
核心抽象是,
LLM 预测 next token,Jev 判断 next distribution。
探索方向
后面可以密切关注三个问题:
1、合成决策数据怎么生成?
2、RLCD 到底优化什么概率目标?
3、Jev 从预训练LLM开始,还是完全针对 decision 设计的 Transformer【文献2】?
笔者推测,一种可能的实现路径是,
在通用语义能力(比如LLM的潜空间)之上,
后训练一个从 State、Question、Type 直接产生概率化 Decision 的模型,
再通过并行采样和代码组合,把它变成代码可以直接调用的智能判断算子。
这等于把 AI 从语言生成器,变成程序中的概率判断函数。
文献1,https://docs.typesafe.ai/introduction
文献2,https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers