数据截至 2026 年 9 月 18 日
模型名字里带着 Pro,也不一定能保住旗舰的位置。DeepSeek 新发的 V4.1-Flash,差点让自家的 V4-Pro 提前退休。
DeepSeek 在 9 月 10 日的发布公告里宣布,计划将 V4-Pro 的请求转给新模型,理由包括性能、价格和速度。可最新 API 文档又表示,应用户需求,9 月 14 日之后继续提供 V4-Pro,计费不变。老旗舰的退休手续,暂时没办成。
读完技术报告和几份评测,我更想弄清楚 V4.1-Flash 怎样重新安排计算和记忆,把智能体的运行成本降下来。至于低价和速度能否变成交付优势,还得看它在具体任务中的表现。
CED 架构与输入计算优化
Flash 的尺寸优势,需要把模型的参数算全。DeepSeek 官方模型卡列出 5520 亿主干参数,另有 1960 亿用于 Engram,一种根据输入查表调用所学局部模式的记忆模块。两者合计约 7480 亿。
结合 Kimi、Qwen 的官方模型卡,以及 Artificial Analysis 和 vLLM 对 GLM-5.3 的统计,可以看到下面的差异。GLM 的公开统计略有出入,表中取近似量级。
计入 Engram 后,Flash 约为 Kimi K3 参数规模的 27%、Qwen 的 31%,与 GLM-5.3 的总量则接近。它们都采用混合专家架构(MoE),每个 token,只调用部分参数。Flash 更一致的优势在于激活参数较少,但这不能直接换算成同比例的速度优势。
设想一个编程助手:读代码、改文件、运行测试、看报错,再继续修改。它写出的改动可能不长,收到的代码、日志和历史记录却越来越多;已有缓存能复用,新材料和缓存未命中的部分仍要重新处理。
DeepSeek 的技术报告把这种输入负担当成了主要优化目标。新的因果编码器—解码器(Causal Encoder–Decoder,简称CED)架构,把主干分成前后各 20 层:长输入主要经过前半段,后半段需要的全局上下文表示,由前半段的结果生成;输出新 token 时,则走完整个链条。
可以把它理解为,先把大块的材料整理成底稿,再供后续层使用。模型还会保存此前内容的中间表示,供后续计算调用,这就是 KV 缓存。
技术报告中介绍,CED 受 YoCo 启发,后者是一种让网络后半段直接共享前半段 KV 缓存的架构,用来减少输入处理时的重复计算。CED 则允许后续层对共享底稿做各自的变换,生成所需的全局 KV,保留不同层加工信息的空间;实际生成哪些缓存,还会结合后文介绍的跨层复用机制来安排。
模型仍要补算末尾的一小段局部上下文,因此并非所有输入计算都严格减半;报告给出的主要激活参数,从生成阶段的 160 亿降到了读取阶段的 80 亿。
这里的巧思,是按工作性质分配算力。输入读越来越多的材料,不必始终付出与生成答案同样的计算代价。
生成端的 DSpark 是一种推测解码方案,先草拟多个 token,再交给主模型核验。DeepSeek 与北京大学在 2026 年 7 月 6 日公开的论文中提出这套方案,并报告其已用于 V4-Flash、V4-Pro 预览版的线上服务,早于 V4.1-Flash。
推测解码本身是已有的方法,DSpark 的特色在于把半自回归草稿生成与置信度调度结合起来:大部分草稿计算并行完成,再用轻量的顺序计算补上 token 间的依赖;核验时根据草稿被接受的可能性和系统负载,动态选择长度,减少无效核验占用的计算资源。
CSA2 与 KV 缓存优化
算得省还不够,存得下、搬得动,同样要处理成本。
长任务积累得越多,KV 缓存占用的显存、存储和传输带宽就越可观。
技术报告中的第二代压缩稀疏注意力(Compressed Sparse Attention 2,简称CSA2),通过筛选上下文中的相关位置,并跨层复用缓存和筛选结果,减少存储与计算开销。它把跨层复用安排成三种模式。
Full 模式生成全局 KV,并挑出要关注的位置;Reindex 模式沿用已有 KV,但按当前层的需要重新挑选;Reuse 模式连挑选结果也一并沿用。各层仍会计算自己的查询和局部缓存,这让模型能在节省存储的同时,保留逐层处理信息的空间。
可以把它想成共用一份资料:有人重新圈重点,有人沿用前面的标记,再完成自己的工作。报告还介绍了分层稀疏索引(Hierarchical Sparse Indexer),先由解码器的一层筛出候选范围,后续重新挑选时只在这个范围内查找,减少对超长上下文的重复扫描。
据报告表示,CSA2 配合低精度存储,将每个 token 的全局 KV 缓存压到 890 字节,约为前代 Flash 的四分之一。
按这个口径计算,一百万 token 的全局缓存约为 0.89GB。不过,这只是全局缓存,模型权重、局部缓存和其他运行开销还得另算。
另一个改动更像过日子得来的经验:有些临时结果,重新算一小段比长期存着更划算。报告中的 SWA Bounded Replay 就采用这种办法,让持久化 KV 缓存的占用进一步降到前代的约八分之一。
Engram 条件记忆与按需查表
DeepSeek 的技术报告将 Engram 称为条件记忆模块,用于根据输入查找训练中学到的局部模式。前面的 KV 缓存保存当前任务的中间计算结果,Engram 的记忆表则属于模型参数,随训练学到如何表示反复出现的短 token 组合。
具体来说,Engram 用相邻的两、三、四个 token 组合定位条目,取出对应的向量,再结合当前上下文决定如何使用。为了控制表的规模,它用多组哈希,把可能出现的大量组合映射到有限的表格位置。
报告给出的 1960 亿记忆参数,并不需要每处理一个 token 就全部参与计算。查询只取出对应条目,地址可以提前确定,因而能从主机内存预取,减少对昂贵显存的依赖。
这种设计给局部模式提供了额外的查表通道,不能据此断定主干就不再学习同样的模式。Engram 也不会自动记住用户的聊天,更不等于能随手更新的外部知识库。
这些改动放在一起,我看到的是一种很务实的设计:需要深算的地方留给计算,需要保留的内容尽量共享,适合查找的记忆单独安放。当然代价也存在,报告承认,稀疏选择和近似重建在尚未覆盖的极端情况下,仍可能损伤能力。
少搬数据,也能省下开销
还有一项改动,藏在层与层之间。报告介绍,mHC 是一种层间连接机制,让相邻模块之间保留多条信息流,并通过训练学习怎样混合和保留其中的信息。原先的计算顺序存在依赖,中间结果需要分几步读写,增加了 GPU 内存中的数据搬运。
新的 single-pass mHC 调整了输入混合系数的使用时序,让当前模块使用前一个模块算好的系数。这样,一部分等待就能消除,部署时再通过 Mega-mHC 把相关操作合到一次执行中。报告称,相比原始实现,这部分激活数据的读写量减半。这个比例只针对该环节,不能换算成整个模型速度翻倍。
算力的账里,也包括让数据及时到位的成本。前面是在减少重复计算和缓存,这里则是让同一份中间结果少搬几趟。
后训练方法与实际任务表现
省下资源,终究还要看能不能把事情做好。
官方模型卡显示,V4.1-Flash 原生接收文字和图片、输出文字,支持百万 token 上下文,并以 MIT 许可证开放权重。对编程助手来说,看截图的意义很具体:页面能运行之后,还可以检查按钮是否错位、图表是否难读,让视觉反馈参与修改。
我看到的一个使用心得提出了一个用法:把网页截图和流量图交给同一个模型,先整理页面上可见的问题与流量变化,再列出待核查清单。模型给出的线索,再由人结合原始数据检查。这是应用设想,还需要实测验证真实效果。
更让我在意的是技术报告对后训练的描述。DeepSeek 明说,这一阶段沿用了已有的算法流程,主要变化集中在训练数据和环境。
它把任务拆成问题、环境和验证系统,从实际工作中的失败案例以及代码仓库构造练习,再由不同智能体负责搭环境、尝试解题、检查题目是否有漏洞,反复修整。
这种训练关心的是一整段工作能否完成。对编程而言,新功能通过检查、旧功能没有被破坏,比生成一份看起来像样的代码更有分量。
DeepSeek 公布的最大推理强度对比表中,V4.1-Flash 的 DeepSWE v1.1(软件工程评测)解决率为 74.2%,Kimi K3 为 67.5%,GLM-5.3 为 66.9%。较少的激活参数,并没有妨碍它在这项任务上取得有竞争力的成绩。
但同一张表里,Flash 的 GPQA Diamond(科学问答评测)成绩为 90.9%,低于 Kimi K3 的 92.9% 和 V4-Pro 的 92.4%;Terminal-Bench 4.0(终端任务评测)为 31.2%,低于 GLM-5.3 的 37.9%。这些厂商汇总分数受测试环境影响,不能推导出哪个模型全面领先。
另一份我看到的五项 SaaS 应用搭建的实践中,比较对象换成了材料中标为 GLM 5.3 Flash 的型号。评测者将它与 DeepSeek 对比,称双方使用相同的任务说明和起始项目,均设为高推理强度,每项最多三次提示,依据浏览器中保留的截图评分。
据这份对比测试,排班应用中,DeepSeek 做出了包含排班和冲突规则的页面,GLM 则在加载时报错,留下空白屏幕。应收账款任务里,GLM 虽然通过构建,界面却仍是默认样式,表格还超出了手机屏幕宽度。构建成功,离用户能顺利操作还有一段距离。
不过,客服工单任务给出了相反的例子:DeepSeek 的分析页在手机上溢出,GLM 保持了布局,评测者把这一轮胜利给了 GLM。库存管理一轮则打平。评测者给五项任务的总评分是 DeepSeek 40 分、GLM 25 分,满分 50 分。
这组结果更适合用来提醒我们怎样验收:页面能否打开,信息是否清楚,小屏幕上能否正常操作。这是五次浏览器交付的个人评分,尚不足以给两款模型的整体编程能力排名,也不能据此认定某项架构改动带来了领先。可惜,这个对比测试没有提供耗时和费用,实际完成任务的成本仍要另算。
同样,开放权重给了部署和修改的自由,数千亿参数的体量却仍有门槛。低激活参数意味着每步少算一些,整套权重依然需要妥善存放和调度。
使用成本与任务交付效率
上述工程最后落实到了一张价格表。
截至 9 月 18 日,DeepSeek 官方高峰时段每百万 token 的价格是:未命中缓存的输入 0.30 美元,输出 1.20 美元,命中缓存的输入仅 0.006 美元;非高峰时段再减半。对反复携带长历史的智能体而言,缓存的账可能比第一眼看到的输出单价更值得细算。
接入现有业务,也有开发成本。DeepSeek 官方 API 文档列出了工具调用、JSON 格式输出,以及 OpenAI 和 Anthropic 格式的接口。工具调用让模型提出操作请求,由外部程序执行;JSON 输出则便于程序继续处理结果。对于已采用相应接口的工具,这些支持有助于减少接入改造,但具体工具仍需接好,原有任务也要重新验收。
但还有一笔账,记在人的时间上。
评测网站 Artificial Analysis 的最大推理强度版本页面显示,它的输出速度约为每秒 207 token,同时也指出它的输出非常冗长。速度衡量的是生成期间每秒吐出多少 token,完成任务还取决于总共生成多少、调用多少次工具,以及返工多少轮。
我看到的一个视频中有个很形象的例子:评测者让 Flash 制作并迭代《帝国时代》的仿作,记录的 API 花费是 3.30 美元,总构建时间却达到 4 小时 14 分钟。评测者观察到,它反复检查、修补,拖长了过程;这只是经 OpenRouter 调用的一次个人工作流记录,不能当成所有部署的速度结论。
DeepSeek 也在尝试控制这种开销。技术报告的图 9 显示,60—80 档的输出 token 少于最大档,但节省比例和准确率变化因评测而异,并非都能省下一半以上。这个设置控制的是思考预算,最大档会增加输出开销,却不保证每项任务都更准确。
所以我会按任务来选。可以放到后台慢慢跑、结果容易验收的工作,低价能换来更多尝试;需要人一直盯着、快速交付的工作,则要把等待和返工一起计价。
这也是我理解 V4.1-Flash 的落点。它展示了怎样通过架构、缓存和训练环境的细活,降低智能体持续工作的成本。至于该不该替换原来的模型,最终要看的,是完成一件合格的工作花了多少钱、多久,又需要人接手几次。开头那款被留下的 Pro,恰好提醒我们保留这份判断。
2026年9月18日