阅读,与值得关注的内容Readance

1.395元复现Jev原型:百度千帆Token Plan最佳实践

。

点击蓝字,关注我们


2026年9月,TypeSafe AI发布了“System One Model”——Jev,随即引发热议。Jev不生成文本、不进行自回归解码,而是通过单次前向传播直接输出带校准概率的结构化决策,支持并行采样,响应时间可达70毫秒。相比“生成文本—解析—验证”的传统路径,这种方式为分类、路由、审核等自动化场景提供了一种新思路。


百度千帆Token Plan致力于帮助开发者以更低、更可预期的成本搭建Jev原型、验证技术方案。我们用Opencode在llama.cpp里复现Jev的核心机制,把“单次前向传播做结构化决策”变成400行C++。而这段“把理念变成现实”的完整旅程:读懂概念、翻遍源码、编译调试、撰写成文,全部由AI自主完成。这次验证基于百度千帆Token Plan个人版,共消耗313.9积分,折合的总花费是:1.395元。


最佳实践总览


图片


整个开发流程由Opencode(以Token Plan个人版中的DeepSeek-V4-Flash为基座模型)自主完成,Token Plan覆盖了全部token消耗。


1.1 开发全流程


图片


关键数字:313.9积分,1.395元。


1.2 为什么Token Plan适合AI开发


AI开发不是一次调用,而是反复试错的迭代过程。探索代码库时AI读了几十个文件,其中很多与最终实现无关。调试时跑了好几轮编译,第一次因为对API理解错误而失败重来。写文章反复修改了好几版。


这些“浪费”在按量计费模式下会让人心疼——用GPT-4o光是试错就可能花掉20多元。但在百度千帆Token Plan下,所有试错成本加起来才1.395元。


预付200元,45000积分随便用。不需要盯着消耗计数器,不需要在每次调用前犹豫“值不值”。放手让AI去探索、去犯错、去修正——这才是AI辅助开发的正确姿势。


实现了什么?


图片


2.1 工作概述


本次在百度千帆Token Plan支持下,AI(DeepSeek-V4-Flash)核心完成了一项针对推理底层机制的改造成本验证:将传统的“文本生成”模式改造为“单次前向传播的结构化决策引擎”。


2.1.1 攻克核心差异与机制改造


  • 传统LLM模式:对复杂多问题场景需要“逐字生成→提取文本→正则解析”,速度慢且极易出现格式崩塌。


  • Jev决策机制:打破自回归生成,将5个业务问题打包在一个Batch中,直接对每个序列最后一个Token的Logits进行Softmax提取,无需生成任何文本,仅凭单次llama_decode()就同时完成全部推理与概率校准,响应时间缩短至70ms级。


AI深入源码库,在llama.cpp中精准定位并编写了约400行C++核心代码,修复了多序列logits位置索引偏移等调试硬骨头,成功在开源大模型上调通了这一机制。


2.1.2 实现标准化的输入与结构化输出


改造后的引擎具备了极高的工程实用性,实现了输入与输出的标准化解耦:


输入:标准JSON配置,输入当前场景状态(如“客户退款、包装损坏、3年老会员”)及待决策的多个问题列表。

 

输出:结构化JSON,一次性返回所有问题的决策选项(如escalate / refund)以及对应的置信度概率分数(Confidence)。

 

(注:整个机制改造与源码调试过程经历了多轮报错与重新编译,全部由AI自主完成,而Token Plan让人完全无需担忧试错成本。)


2.2 实测结果


用Qwen3-0.6B-Q8_0.gguf,输入客服场景(客户退款、包装损坏、3年老会员),同时回答5个问题:


图片


5个问题,1次推理,0次字符串生成。每个决策附带概率分数,软件可以直接消费。温度从0.8降到0.3,action的deny置信度从62.5%飙升到89.4%——温度越低模型越自信。


但需要明确:置信度不等于准确率。置信度反映的是模型对自身输出的确定程度,温度调低只是让分布更尖锐,模型自然显得更“自信”,但这不意味着答案更可能正确。本次测试没有标注好的测试集,无法计算准确率。从结果表现看,客服场景中“流失风险”和“优先级”这类有明确信号的问题,模型在合理温度下给出的决策方向符合直觉;而“客户情绪”这类主观判断,模型的置信度偏低(55.9%),这个低置信度本身是有意义的信号——它在告诉下游系统“这个判断不太确定,建议人工复核”。这正是结构化概率输出的价值:即使答案不一定对,软件也能根据置信度做路由决策。


2.3 与Jev原版的差距


图片


Jev从模型架构和训练方法(RLCD)层面支持结构化决策。我们是在现有LLM上模拟。但核心机制——单次前向传播、并行决策、概率输出——已经跑通。而验证这个理念是否可行,只花了1.395元。


与Agent交互的

Prompt实践


图片


整个开发过程不是一句话指令“帮我实现Jev”就完事,而是分阶段的、有结构的对话。下面还原关键的交互流程和Prompt思路,供其他开发者参考。


3.1 整体交互流程


图片


3.2 关键Prompt实录


第一步:确认开发基础(概念)

不要只说“实现Jev”,而是给出全部素材和明确的三步目标:

请你基于[博客HTML路径]和[GGUF模型路径]实现jev模式推理我希望你:1. 梳理路径2. 修改llamacpp实现jev

关键点:同时给出博客原文(Agent需要自己理解Jev是什么)和模型文件路径(Agent需要知道用什么模型)。明确交付物。Agent会自行抓取博客、探索代码库、确定实现方案,不需要逐步指导。


第二步:验收

Agent说“完成了”之后,不要直接接受。需要指定验收标准:

请基于下述场景,进行测试:客户xxxx,客户情绪是 A B C D。

这一步的意图是:用一个业务场景(客服情绪分类)测试Agent的输出是否真的可用。结果确实暴露了问题——0.6B小模型上label-token方式的概率接近随机,所有选项置信度都在0.25左右。Agent被逼着去解决位置偏好问题,最终实现了排列去偏和continuation scoring两种方案。


第三步:结果纠偏

拿到测试结果后,对技术结论做纠偏:

 反馈1: 零幻觉和高置信度jev是无法保证的,jev只是保证输出类型安全 反馈2: 温度越低置信度自然越高,但置信度不等于准确率,没有测试集无法计算准确率

这是最重要的交互——人对Jev的理解比Agent更准确。通过人工复核修正Agent撰写的结果,从而使得整个结论更加合理可靠。


3.3 Prompt经验总结


图片


核心原则:Agent负责执行,人负责判断。Agent能快速读几十个源文件、写几百行C++、编译调试,但技术结论的准确性需要人把关。特别是“零幻觉”“校准概率”这类概念,Agent从博客原文照搬,但工程上需要更精确的表述。


百度千帆Token Plan

让探索性开发成本趋近于零


图片


用Opencode(以Token Plan个人版中的DeepSeek-V4-Flash为基座模型)在llama.cpp中复现Jev推理模式,将自回归LLM改造为并行决策引擎。1.395元即可完成一次从论文阅读、代码实现到文章撰写的完整开发周期;200元的Token Plan套餐,足够跑143次类似任务。


图片


Jev模式的核心洞察是:很多AI应用需要的不是文本生成,而是结构化决策。传统LLM通过“生成文本->解析->验证”的迂回路径实现决策,Jev模式直接从logits提取决策概率,跳过了字符串生成和解析的开销。需要强调的是,Jev保证的是输出类型安全——答案一定在预定义选项内,但答案本身是否正确仍取决于模型能力。置信度也不等于准确率,它只是模型对自身判断的确定程度。真正有价值的是:软件可以根据置信度做路由,低置信度的问题转人工,高置信度的问题自动处理。


而百度千帆Token Plan的价值在于:它让这种探索性开发的试错成本趋近于零。1.395元验证一个前沿AI理念是否可行——不需要几万元的API预算,不需要纠结每次调用的花费。放手让AI去探索,这才是Token Plan的意义。



如果你也想用1.395元这样的成本,去验证一个自己感兴趣的技术想法,那这次实验里用到的百度千帆Token Plan个人版,可以直接上手。


它是面向个人开发者与AI重度用户的大模型订阅服务,定位是“个人的AI算力流量包”,一份订阅、一个额度池,覆盖AI Coding、Agent构建、智能问答、内容生成、学习研究等场景。


图片

 END

  推荐阅读

Agentic Harness Workflow 框架:把 AI Coding 变成工程化流程


什么样的业务经验值得做成 Agent:从个人工具到组织资产


都在开源 Harness,Codex 和 DeepSeek 到底有什么不一样?


DeepSeek Harness:重新设计 Agent 运行时


Workspace 实践:从个人提效到组织提效


图片
一键三连,好运连连,bug不见👇

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →