刚刚,DeepSeek V4.1 Flash 正式上线,模型权重和技术报告同步公开。
之前实测时,就留意到内测问卷里的问题:V4.1 Flash 能否完全取代 V4 Pro?
现在,DeepSeek 给出了自己的答案。
作为 DeepSeek 新架构系列中最小的模型,V4.1 Flash 将更快推理、更高吞吐量作为设计目标:
更智能、更快速、更高效
读取输入和生成答案采用不同的计算安排,全局 KV 缓存约为上一代 Flash 的四分之一。
原生图文理解、编程与工具任务能力,以及长上下文的计算成本,是这次更新的重点。
DeepSeek Harness 也已适配新模型。从识别截图,到读取项目文件、修改代码,新 Flash 有了直接进入实际工作流的入口。
随着这次发布,DeepSeek 还公布了一个明确安排:9 月 14 日 12:00 之后,V4 Pro 的 API 请求将转由 V4.1 Flash 处理,按 Flash 价格收费,持续至未来 V4.1 Pro 上线。
看来这次 Flash 的更新,已经影响到 DeepSeek 主力模型 Pro 的真正地位了。
◈01 模型与权重一起开放
V4.1 Flash 采用新架构,从预训练阶段就共同学习图片与文字。
这让“看图”能够直接参与模型处理任务的过程。例如,用户给出一张页面截图,模型可以理解其中的布局和文字,再结合代码文件继续工作;遇到图表,也可以把视觉信息纳入分析。
不过当前公开能力并不包含图片生成。
模型保留了百万 token 上下文,API 最大输出长度为 384K token,可以容纳较长的代码、文档和任务记录。
开放的也不只有模型权重。
官方仓库同时提供技术报告、编码示例、推理参考实现及评测复现资料,模型权重采用 MIT 许可。开发者可以进一步研究、部署和修改,但具体运行仍需匹配硬件与推理框架。
◈02 编程与工具任务提升明显
相比上一代 Flash,这次比较突出的提升,出现在需要模型持续操作工具、完成多步工作的任务里。
在 DeepSeek 公布的对比结果中:
两项测试,新 Flash 都超过了 V4 Pro!
DeepSWE 考查模型处理代码库问题的能力,需要理解项目并完成修改;Terminal-Bench 则要求模型在终端环境中完成任务。它们比单次问答更接近编程助手的工作方式。
新 Flash 在这两项中都超过了 V4 Pro。尤其是 DeepSWE,相比旧 Flash 提高了 19.8 个百分点。
图文能力也进入了工具评测。官方报告中,V4.1 Flash 在图表视觉任务 Chartography 的带工具测试里取得 78.9 分,展示了结合图像信息与工具解决问题的能力。
◈03 长任务的计算和价格都在调整
要理解这次架构为什么改,可以先看 AI 写代码时在做什么。
它读完需求,查看文件,运行命令,再把工具结果放回上下文。任务往前走,下一轮需要读取的材料也越来越多。最终交付可能只有几个文件,中间却已经反复处理了大量输入。
V4.1 Flash 对这两个阶段做了不同安排:读取输入时,每个 token 约激活 80 亿参数;生成答案时,约激活 160 亿参数。
这套因果编码器—解码器结构,将处理输入与生成输出的计算分开设计,面向长任务中输入量大的特点降低计算负担。
保存上下文的方式也有变化。
模型会保留已经处理过的信息,供后续生成继续使用,这类状态通常称为 KV 缓存。按照技术报告口径,新模型的全局 KV 缓存约为 V4 Flash 的 四分之一,持久缓存约为 八分之一。
前者关系到高速显存中的缓存占用,后者关系到状态持久化存储。
用户更直接能看到的,是新的 API 单价:
高峰时段为北京时间周一至周五 9:00—12:00、14:00—18:00,其余为空闲时段。
空闲时段,百万 token 的缓存命中输入,只要两分钱。
◈04 Harness 已接入,还练了团队协作
模型要把一项任务做完,需要能接触文件、调用工具,并根据执行结果继续调整。
DeepSeek Harness 提供的就是这套工作环境。目前,官方适配代码已经加入正式模型 deepseek-flash,并声明支持文字与图片输入。
这次技术报告还披露了另一项进展:V4.1 Flash 对多 Agent 团队协作进行了专门训练。
遇到复杂任务,主助手可以把工作拆开,分给不同的助手。大家在同一个代码目录里工作,通过消息和任务板同步进度,最后由主助手检查代码、运行测试。
但助手多了,也可能互相等消息、反复交接,忙了一圈却把任务拖慢。
因此,训练除了奖励完成任务,也鼓励有用的分工和沟通,并对拖慢整体进度的协作施加惩罚。
效果如何?
DeepSeek 从 ProgramBench 中筛选了 172 个编程任务,分别让单个助手和多个助手组队完成。
同样给 8 小时,团队模式达到预设完成标准的比例为 30.04%,单助手为 20.39%,相差约 9.7 个百分点。
想把新模型用起来,DeepSeek Harness 已经完成正式模型和图片输入的适配。
按官方说明安装 Node.js 后,可以运行:
npx @deepseek-ai/dsh web
启动后,在设置中配置 DeepSeek API Key,选择模型和工作区,即可开始任务。
(ps:Harness 当前仍处于开发者预览阶段。)
通过 API 接入时,正式模型名使用 deepseek-flash。旧的 Flash 和 Vision Exp 名称暂时兼容,但实际请求已经由 V4.1 Flash 提供服务。
从此次公开的设计看,DeepSeek 正在把更多优化放到 AI 连续工作的过程中:大量材料怎么读、上下文怎么存、工具怎么用,以及多个助手怎么配合。
新 Flash 也已经在工具任务成绩、输入计算和团队协作上做了调整。
接下来,把它接进真实项目时,去看看真正效果如何。
参考文献
[1] DeepSeek 官方更新日志: https://api-docs.deepseek.com/zh-cn/updates/
[2] DeepSeek V4.1 Flash 模型仓库与模型卡: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash