阅读,与值得关注的内容Readance

藏在DeepSeek V4.1 Flash里的黑科技全被挖出来了

大家好,我是PaperAgent,不是Agent!

DeepSeek 又双叒发(&开源)新模型了。这次的主角是 DeepSeek-V4.1-Flash——官方定位是新架构家族中最小的模型,552B 主干参数、原生多模态、支持 100 万 token 上下文,只激活 16B 参数,prefill 时更是只激活 8B。

整篇论文本质上是在回答一个问题——当 Agent 时代来临、上下文动辄几十万上百万 token 时,怎么把记忆的成本打下来?

DeepSeek-V4.1-Flash:
Pushing the Limits of KV Cache Compression
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

答案是:每 token 全局 KV Cache 只要 890 字节,是 DeepSeek-V4-Flash 的 1/4,是 DeepSeek-V1 的 1/437。

Figure 1:历代 DeepSeek 模型的全局 KV Cache 体积演进
Figure 1:历代 DeepSeek 模型的全局 KV Cache 体积演进

一、Agent 时代,贵的不算力而是记忆

长周期 Agent(long-horizon agent)的负载有一个鲜明特征:输入极重(input-heavy)。每一次工具调用、每一轮交互,都要把超长的上下文重新 prefill 一遍;同时海量的 KV Cache 挤爆 HBM 显存,持久化到 SSD 上又吃容量和带宽。算力、存储、带宽三座大山一起压下来,部署成本就下不去。

Figure 2:上下文从 4K 拉到 1M(256 倍),V4.1-Flash 的 Decode FLOPs 只增长了 1/4,几乎是一条水平线;而 V1、V3.2、V4-Flash 都在随长度显著上涨。

DeepSeek-V4 时代已经用稀疏注意力把长序列计算成本降下来了,于是存储和搬运成了新的瓶颈。V4.1-Flash 的全部设计,就是围绕"把 KV Cache 压到极致"展开的——而且是在性能反超前代的前提下完成的。

二、一张架构图看懂 DeepSeek V4.1-Flash

Figure 3:整体架构
Figure 3:整体架构

核心配置一览:

对比前代:V4-Flash 激活 13B、V4-Pro 激活 49B,V4.1-Flash 只用 1/3 的总参数和 1/4 的激活参数,就在基座评测上打平甚至反超 V4-Pro。

三、CED技术——Prefill 计算量直接砍半

Agent 工作流里工具调用频繁,KV Cache 一旦 miss,超长上下文的 prefill 就是吞算力的怪兽。DeepSeek 的解法是 Causal Encoder-Decoder(CED) 架构,灵感来自微软的 YoCo,但做了结构性升级。

https://arxiv.org/pdf/2405.05254
https://arxiv.org/pdf/2405.05254

思路非常暴力美学:

  • 下半截当编码器:40 层 Transformer 的底部 20 层是因果编码器;
  • 上半截解码器不自己算全局 KV:第 20 层往上的所有解码器层,它们的全局 KV 不再由各自的隐状态生成,而是直接用第 20 层(编码器最后一层)的隐状态投影出来,每层配一组专属投影权重。

效果:当序列长度 N 远大于窗口大小时,prefill 复杂度从 O(N·L) 降到约 O(N·L/2)——计算量直接腰斩。

四、CSA2技术——跨层白嫖KV Cache 的三档模式

如果说 CED 是省 prefill 的算力,那 Compressed Sparse Attention 2(CSA2) 就是省 KV Cache 的存储。它是这篇论文真正的主角。

4.1 三个维度一起压

论文把 KV Cache 压缩梳理成三个可乘的维度:

  1. 条目大小:GQA 减少 KV 头数、MLA 共享隐向量;
  2. 序列维度:每 m 个 token 压成 1 个条目(V4 的 CSA/HCA);
  3. 层的维度:让一些层直接复用其他层的缓存和选择结果。

此前的方案(IndexCache、YOIO、HySparse 等)都只覆盖其中一两个维度,CSA2 是第一个把三个维度一起榨干的。

4.2 Full / Reindex / Reuse 三档模式

CSA2 给每一层静态分配三种模式之一:

Figure 4:三种模式的区别只在于 main KV、indexer K、Top-K 索引从哪来
Figure 4:三种模式的区别只在于 main KV、indexer K、Top-K 索引从哪来
  • Full Mode(全量):完整流程,自己算 main KV、indexer K,自己跑索引器选出 Top-K;
  • Reindex Mode(重索引):直接复用前面层的 main KV 和 indexer K,但用自己的 indexer Q 重新打分、选出新的 Top-K——缓存共享了,但稀疏选择仍可逐层变化;
  • Reuse Mode(纯复用):main KV 和 Top-K 索引全部复用,自己只算 Q 和 SWA KV,索引器都懒得跑。

4.3 分层稀疏索引器:让索引成本与上下文长度"脱钩"

跨层复用索引减少了索引器的运行次数,但剩下的索引器仍要对整个可见上下文打分——上下文到 1M 时,这本身就是瓶颈。

Figure 5 Hierarchical Sparse Indexer
Figure 5 Hierarchical Sparse Indexer

Hierarchical Sparse Indexer 的妙处在于:浅层索引器的选择结果天然可以作为深层索引器的搜索范围,不需要引入任何额外状态。候选池大小固定后,**深层索引器的单查询成本从"随上下文线性增长"变成"常数"**。而且这套机制是训练感知的——后训练阶段就按同样的候选域训练,训推一致。

五、Single-Pass mHC + Mega-mHC 内核

V4 引入的 mHC 在相邻 Transformer 块之间维护 n 条残差流,用逐 token 预测的系数做混合。理论下界是 (2n+2)d 的激活访存量,但 V4 的三内核实现实际要 (4n+4)d——多跑了一倍。

https://arxiv.org/pdf/2405.05254
https://arxiv.org/pdf/2405.05254

V4.1 的解法堪称教科书级的"依赖消除":把输入混合系数平移一个块——每个块消耗的是上一个块算出的混合系数。这一下,数据依赖消失,残差更新、输入混合、系数预测三件事可以融进一次遍历。

部署侧配合融合的 Mega-mHC 内核(按隐藏维度分 tile,顺带把 pre-norm 和 FP8 转换也吞进去),激活访存压到理论下界 (2n+2)d,相比原实现直接减半。更妙的是:这个平移不改变语义,预训练可以继续用老的多内核实现,只有部署端享受红利。

六、预训练:45T token、原生多模态、基座反超大杯

  • 数据:45T token 多模态语料,文本与多模态 token 比 7:1;
  • 训练:从 64K 序列长度从零开始训练稀疏注意力,34T token 处扩到 1M;batch 固定 1.006 亿 token;视觉编码器先冻结、学习率衰减阶段解冻联合训练;
  • DeepSeek-ViT:从零训练,2D-RoPE 支持任意分辨率,patch 卷积换成线性投影以兼容 Muon;先 SigLIP 对比预训练(约 470 亿图文对),再接一个 4B MoE LLM 做自回归微调(236B token),最后只保留视觉编码器。

基座对比见下表(Table 1 精选):

内部 held-out 语料上的 BPB(越低越好)同样全面领先:

Figure 6 V4.1-Flash-Base 的 BPB 全面低于 V4-Flash-Base 和 V4-Pro-Base,赢面 5%–10%
Figure 6 V4.1-Flash-Base 的 BPB 全面低于 V4-Flash-Base 和 V4-Pro-Base,赢面 5%–10%

七、后训练:数据管线才是本体

配方就是标准的 SFT → RL → 在策略蒸馏(OPD)。所有的提升都来自数据和环境管线的规模化。

每个任务被形式化为(问题、环境、验证系统)三元组,以"难度"和"正确性"为奖励信号迭代训练模型的造题能力:

  • 通用 Agent:收集内部员工和外部伙伴的真实工作流,批量构建复刻真实 SaaS / 企业系统接口的 mock 工具;再把真实失败案例系统化重放,做针对性 RL;
  • Coding Agent:从高难度真实会话 + 达标 GitHub 仓库出发,由多个专职 Agent 流水线协作。

RL Scaling:越练越强,还能合并存档

Figure 7:DeepSWE v1.1、SWE-Bench Pro、Terminal-Bench v2.1/v3.0 上,Pass@1 随累计 RL 步数稳定上涨;把上下文从 512K 扩到 1M 后,超长程任务(Terminal-Bench v3.0)还能继续涨。断开的曲线段是模型合并后重新初始化的后续 RL run。

Figure 8:左图为跨多个 Claude Code 版本联合 RL,右图为跨 OpenCode、Pi、DeepSeek Harness(Standard/PTC)等异构脚手架联合 RL,平均 Pass@1 均持续提升。

十三、评测:小身板,正面刚旗舰

Table 3 主表:

几个亮点:

  • Codeforces 3471,反超自家 V4-Pro(3348);MathArena Apex 65.6% 与最强开源 Kimi-K3 打平;
  • DeepSWE v1.1 74.2%,力压 Opus-5(74.0%)和 GPT-5.6 Sol(73.0%),相比 V4-Flash 的 54.4% 是质变;

跨脚手架鲁棒性

在 Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness 三种模式共 8 种配置下(Table 4),DeepSWE v1.1 在 65.5–74.2 之间、Terminal-Bench v2.1 在 84.1–90.6 之间波动——能力不绑定特定脚手架,这归功于训练时合成环境的多样性。

多智能体:Agent Team 全面压制单兵作战

Figure 10:DeepSeek Harness 的 Agent Team 模式下,ProgramBench 8 小时档 Almost@1 达 30.04%(单 Agent 20.39%),FrontierSWE v2 20 小时档 Mean@5 达 32.90%(单 Agent 28.20%)——每个时限档多智能体都占优。训练信号包含任务奖励 + 协作奖励 + 基于 DAG 关键路径的衍生时延惩罚。

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
动手设计AI Agents:(编排、记忆、插件、workflow、协作)
Loop工程已死,Graph工程永生
一篇Loop+Harness的自进化Agent最新综述
2026,做Agentic AI,绕不开这两篇开年综述
已经读到这了,不妨点个👍、❤️、↗️三连,加个星标⭐,不迷路哦~

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →