点击蓝字,关注我们
2026年9月,TypeSafe AI发布了“System One Model”——Jev,随即引发热议。Jev不生成文本、不进行自回归解码,而是通过单次前向传播直接输出带校准概率的结构化决策,支持并行采样,响应时间可达70毫秒。相比“生成文本—解析—验证”的传统路径,这种方式为分类、路由、审核等自动化场景提供了一种新思路。
百度千帆Token Plan致力于帮助开发者以更低、更可预期的成本搭建Jev原型、验证技术方案。我们用Opencode在llama.cpp里复现Jev的核心机制,把“单次前向传播做结构化决策”变成400行C++。而这段“把理念变成现实”的完整旅程:读懂概念、翻遍源码、编译调试、撰写成文,全部由AI自主完成。这次验证基于百度千帆Token Plan个人版,共消耗313.9积分,折合的总花费是:1.395元。
最佳实践总览
整个开发流程由Opencode(以Token Plan个人版中的DeepSeek-V4-Flash为基座模型)自主完成,Token Plan覆盖了全部token消耗。
1.1 开发全流程
关键数字:313.9积分,1.395元。
1.2 为什么Token Plan适合AI开发
AI开发不是一次调用,而是反复试错的迭代过程。探索代码库时AI读了几十个文件,其中很多与最终实现无关。调试时跑了好几轮编译,第一次因为对API理解错误而失败重来。写文章反复修改了好几版。
这些“浪费”在按量计费模式下会让人心疼——用GPT-4o光是试错就可能花掉20多元。但在百度千帆Token Plan下,所有试错成本加起来才1.395元。
预付200元,45000积分随便用。不需要盯着消耗计数器,不需要在每次调用前犹豫“值不值”。放手让AI去探索、去犯错、去修正——这才是AI辅助开发的正确姿势。
实现了什么?
2.1 工作概述
本次在百度千帆Token Plan支持下,AI(DeepSeek-V4-Flash)核心完成了一项针对推理底层机制的改造成本验证:将传统的“文本生成”模式改造为“单次前向传播的结构化决策引擎”。
2.1.1 攻克核心差异与机制改造
传统LLM模式:对复杂多问题场景需要“逐字生成→提取文本→正则解析”,速度慢且极易出现格式崩塌。
Jev决策机制:打破自回归生成,将5个业务问题打包在一个Batch中,直接对每个序列最后一个Token的Logits进行Softmax提取,无需生成任何文本,仅凭单次llama_decode()就同时完成全部推理与概率校准,响应时间缩短至70ms级。
AI深入源码库,在llama.cpp中精准定位并编写了约400行C++核心代码,修复了多序列logits位置索引偏移等调试硬骨头,成功在开源大模型上调通了这一机制。
2.1.2 实现标准化的输入与结构化输出
改造后的引擎具备了极高的工程实用性,实现了输入与输出的标准化解耦:
输入:标准JSON配置,输入当前场景状态(如“客户退款、包装损坏、3年老会员”)及待决策的多个问题列表。
输出:结构化JSON,一次性返回所有问题的决策选项(如escalate / refund)以及对应的置信度概率分数(Confidence)。
(注:整个机制改造与源码调试过程经历了多轮报错与重新编译,全部由AI自主完成,而Token Plan让人完全无需担忧试错成本。)
2.2 实测结果
用Qwen3-0.6B-Q8_0.gguf,输入客服场景(客户退款、包装损坏、3年老会员),同时回答5个问题:
5个问题,1次推理,0次字符串生成。每个决策附带概率分数,软件可以直接消费。温度从0.8降到0.3,action的deny置信度从62.5%飙升到89.4%——温度越低模型越自信。
但需要明确:置信度不等于准确率。置信度反映的是模型对自身输出的确定程度,温度调低只是让分布更尖锐,模型自然显得更“自信”,但这不意味着答案更可能正确。本次测试没有标注好的测试集,无法计算准确率。从结果表现看,客服场景中“流失风险”和“优先级”这类有明确信号的问题,模型在合理温度下给出的决策方向符合直觉;而“客户情绪”这类主观判断,模型的置信度偏低(55.9%),这个低置信度本身是有意义的信号——它在告诉下游系统“这个判断不太确定,建议人工复核”。这正是结构化概率输出的价值:即使答案不一定对,软件也能根据置信度做路由决策。
2.3 与Jev原版的差距
Jev从模型架构和训练方法(RLCD)层面支持结构化决策。我们是在现有LLM上模拟。但核心机制——单次前向传播、并行决策、概率输出——已经跑通。而验证这个理念是否可行,只花了1.395元。
与Agent交互的
Prompt实践
整个开发过程不是一句话指令“帮我实现Jev”就完事,而是分阶段的、有结构的对话。下面还原关键的交互流程和Prompt思路,供其他开发者参考。
3.1 整体交互流程
3.2 关键Prompt实录
第一步:确认开发基础(概念)
不要只说“实现Jev”,而是给出全部素材和明确的三步目标:
请你基于[博客HTML路径]和[GGUF模型路径]实现jev模式推理我希望你:1. 梳理路径2. 修改llamacpp实现jev
关键点:同时给出博客原文(Agent需要自己理解Jev是什么)和模型文件路径(Agent需要知道用什么模型)。明确交付物。Agent会自行抓取博客、探索代码库、确定实现方案,不需要逐步指导。
第二步:验收
Agent说“完成了”之后,不要直接接受。需要指定验收标准:
请基于下述场景,进行测试:客户xxxx,客户情绪是 A B C D。这一步的意图是:用一个业务场景(客服情绪分类)测试Agent的输出是否真的可用。结果确实暴露了问题——0.6B小模型上label-token方式的概率接近随机,所有选项置信度都在0.25左右。Agent被逼着去解决位置偏好问题,最终实现了排列去偏和continuation scoring两种方案。
第三步:结果纠偏
拿到测试结果后,对技术结论做纠偏:
反馈1: 零幻觉和高置信度jev是无法保证的,jev只是保证输出类型安全反馈2: 温度越低置信度自然越高,但置信度不等于准确率,没有测试集无法计算准确率
这是最重要的交互——人对Jev的理解比Agent更准确。通过人工复核修正Agent撰写的结果,从而使得整个结论更加合理可靠。
3.3 Prompt经验总结
核心原则:Agent负责执行,人负责判断。Agent能快速读几十个源文件、写几百行C++、编译调试,但技术结论的准确性需要人把关。特别是“零幻觉”“校准概率”这类概念,Agent从博客原文照搬,但工程上需要更精确的表述。
百度千帆Token Plan
让探索性开发成本趋近于零
用Opencode(以Token Plan个人版中的DeepSeek-V4-Flash为基座模型)在llama.cpp中复现Jev推理模式,将自回归LLM改造为并行决策引擎。1.395元即可完成一次从论文阅读、代码实现到文章撰写的完整开发周期;200元的Token Plan套餐,足够跑143次类似任务。
Jev模式的核心洞察是:很多AI应用需要的不是文本生成,而是结构化决策。传统LLM通过“生成文本->解析->验证”的迂回路径实现决策,Jev模式直接从logits提取决策概率,跳过了字符串生成和解析的开销。需要强调的是,Jev保证的是输出类型安全——答案一定在预定义选项内,但答案本身是否正确仍取决于模型能力。置信度也不等于准确率,它只是模型对自身判断的确定程度。真正有价值的是:软件可以根据置信度做路由,低置信度的问题转人工,高置信度的问题自动处理。
而百度千帆Token Plan的价值在于:它让这种探索性开发的试错成本趋近于零。1.395元验证一个前沿AI理念是否可行——不需要几万元的API预算,不需要纠结每次调用的花费。放手让AI去探索,这才是Token Plan的意义。
如果你也想用1.395元这样的成本,去验证一个自己感兴趣的技术想法,那这次实验里用到的百度千帆Token Plan个人版,可以直接上手。
它是面向个人开发者与AI重度用户的大模型订阅服务,定位是“个人的AI算力流量包”,一份订阅、一个额度池,覆盖AI Coding、Agent构建、智能问答、内容生成、学习研究等场景。
END
推荐阅读
Agentic Harness Workflow 框架:把 AI Coding 变成工程化流程
都在开源 Harness,Codex 和 DeepSeek 到底有什么不一样?
DeepSeek Harness:重新设计 Agent 运行时