中金研究
我们认为,DeepSeek V4.1 Flash的核心意义,是通过架构和推理系统优化,以更低的计算、存储和访存成本,实现更高的任务完成效率与单位GPU产出。更直观地看,新模型为当下NVIDIA Hopper系列GPU及类似产品“续命一代”:Global/Persistent KV Cache压缩约75%/87.5%,打破模型规模与硬件需求同步膨胀的线性关系;同时以更小动态计算量,改善系统吞吐,增大用户并发。以V4.1 Flash的优化逻辑推演,我们看到原本需在NVIDIA Blackwell系列64卡系统承载的10T模型,有望在64卡Hopper系列系统完成部署,即2026-2027年主流性能的国产算力芯片(如昇腾960系列)有望支持国产模型向10T-20T参数量平台持续扩张,国产算力需求的逻辑闭环再一次被印证。
Abstract
摘要
降本:V4.1 Flash并非简单缩小模型,而是系统性减少长上下文推理中的重复计算、存储和数据搬运。CED将40层Transformer拆分为20层Encoder与20层Decoder,使长Prompt无需完整经过后20层Decoder,从而降低Prefill计算量。CSA2通过Full、Reindex、Reuse三类层分工复用Global KV与Top-K;叠加FP4 Main KV和SWA Bounded Replay后,Global KV Cache降至V4 Flash的约1/4,Persistent KV Cache降至约1/8。同时,Single-Pass mHC通过Kernel Fusion减少Activation重复读写,进一步缓解HBM带宽压力。
增效:V4.1 Flash通过更小动态计算、外置记忆和更高Decode吞吐,以更低单位资源消耗获得更高任务完成效率。其Prefill和Decode阶段每Token分别仅激活约8B和16B参数;Engram将部分静态知识从主干动态计算中剥离并按需检索;DSpark则通过轻量Draft、置信度预测和动态调度提升Decode效率。
风险
模型价格竞争风险,硬件供应链风险,AI商业化风险。
Text
正文
效果:V4.1-Flash在多数Coding/Agent场景已具备替代V4-Pro能力,API价格较V4进一步下降
V4.1-Flash以更低资源消耗实现接近甚至部分超过V4-Pro的模型能力,体现出显著的降本增效。2026年9月10日,DeepSeek官网称,V4.1-Flash通过新的预训练方式和更大规模RL后训练,在综合基准测试中已超过包括V4-Pro在内的旗舰模型,并表示多方测试显示其在性能、费用、速度及总用时等指标上已全面超过V4-Pro。从DeepSeek-V4.1-Flash技术报告的细分指标看,其在Codeforces、MathArena及多数Agent/Coding基准上达到或超过V4-Pro,但并非所有维度均全面领先,在部分世界知识、高难推理及长上下文指标上仍存在差距。例如Base模型SimpleQA为42.3% vs Pro 55.2%、LongBench-V2为45.2% vs 51.5%;Post-training模型GPQA Diamond为90.9% vs 92.4%、HLE为36.8% vs 42.7%。因此我们认为,V4.1-Flash的核心突破并非单纯追求所有Benchmark绝对领先,而是在大幅降低激活计算、KV Cache容量和API价格的情况下,将整体能力提升至Pro级甚至在Coding/Agent场景实现反超,大幅改善单位智能成本。
图表1:DeepSeek V4.1-Flash与V4-Flash、Pro特质对比
资料来源:DeepSeek-AI《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,中金公司研究部
图表2:闲时API价格:V4.1-Flash、V4-Flash、V4-Pro
注:V4-Flash及V4-Pro价格采用DeepSeek于2026年8月17日起执行的V4系列API定价,V4.1-Flash采用2026年9月10日起执行的新定价;闲时价格为高峰时段的1/2,高峰时段为北京时间工作日9:00–12:00、14:00–18:00,其余时段为闲时。Artificial Analysis混合价格按缓存命中、普通输入及输出Token数量7:2:1加权计算,单位为美元/百万Token。
资料来源:DeepSeek官网,Artificial Analysis,中金公司研究部
图表3:高峰时API价格:V4.1-Flash、V4-Flash、V4-Pro
注:V4-Flash及V4-Pro价格采用DeepSeek于2026年8月17日起执行的V4系列API定价,V4.1-Flash采用2026年9月10日起执行的新定价;闲时价格为高峰时段的1/2,高峰时段为北京时间工作日9:00–12:00、14:00–18:00,其余时段为闲时。Artificial Analysis混合价格按缓存命中、普通输入及输出Token数量7:2:1加权计算,单位为美元/百万Token。
资料来源:DeepSeek官网,Artificial Analysis,中金公司研究部
V4.1-Flash有望推动10T模型的部署需求由B300下沉至H200。我们假设Pro式与Flash式模型总参数均为10T、权重均采用FP8,且部署于64卡计算域。Pro式模型的10T权重全部常驻GPU;Flash式模型按当前Engram参数占比线性外推,假设2.62T参数外置至Host CPU DRAM,GPU常驻权重降至7.38TB。
权重外置与KV Cache压缩共同降低HBM需求。在512个百万Token会话的测算情景下,Pro式模型的Global KV约占1.82TB,叠加10TB权重后,64张B300剩余约6.61TB显存;Flash式模型的Global KV降至约0.46TB,叠加7.38TB常驻权重后,64张141GB H200合计提供约9.02TB HBM,剩余约1.18TB显存。由此我们看到,相较于需由64张B300承载的Pro式模型,同为10T参数规模的Flash式模型在理论容量上有望下沉至64张H200部署。
图表4:10T模型FP8部署测算:V4.1-Flash式模型有望由64张B300下沉至64张H200
注:现有模型方面,V4-Pro主干参数约1.6T、每Token激活参数约49B;V4.1-Flash包含552B主干参数与196B Engram参数,Prefill/Decode阶段每Token分别激活约8B/16B。Global KV方面,V4-Flash约为3,560 Bytes/Token,V4.1-Flash约为890 Bytes/Token。我们进一步构建10T模型情景:假设V4.1-Flash维持现有Engram参数占比,则约2.62T参数可外置至Host CPU DRAM,约7.38T参数常驻GPU;按现有激活比例外推,Pro式模型每Token激活参数约306B,Flash式模型Prefill/Decode阶段分别约107B/214B。假设同时保留512个百万Token会话,Pro式和Flash式模型的Global KV分别约为1.82TB和0.46TB,其中Pro式模型借用V4-Flash的单位Token缓存量测算,并非V4-Pro实测值。硬件容量方面,64张B300按288GB/卡计算,总HBM约18.43TB;64张H200按141GB/卡计算,总HBM约9.02TB;64张H100按80GB/卡计算,总HBM约5.12TB。由此测算,Pro式模型在64张B300上的理论剩余显存约6.61TB;Flash式模型在64张H200上的理论剩余显存约1.18TB,而在64张H100上仍存在约2.72TB显存缺口。上述测算尚未扣除通信缓冲、运行时Workspace等额外显存开销
资料来源:DeepSeek-AI《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,中金公司研究部
动态计算量下降进一步改善H200部署的可行性。按现有模型的激活比例外推,10T Flash式模型在Prefill和Decode阶段的激活参数分别约为107B和214B,均低于Pro式模型两个阶段约306B的激活参数。为验证算力容量,我们假设系统承载长上下文Agent/Coding负载:共有512个在线会话,每个用户平均每5分钟提交一次请求,单次平均输入64K、输出1.5K Tokens,单用户Decode速度为30 Tokens/s。由此,系统平均每秒新增约1.71个请求,对应约109K Prefill Tokens/s;每次回复约需50秒,任一时点约有85个会话同时生成,合计约2.56K Decode Tokens/s。按照FLOPs/Token约等于2倍激活参数量估算,10T Pro式和Flash式模型的持续算力需求分别约为68.4和24.5 PFLOPS,后者下降约64%。若按FP8 Dense峰值算力的40%作为有效可用算力,64张B300和64张H200分别可提供约115.2和50.7 PFLOPS,因此Pro+B300与Flash+H200均可覆盖目标负载;若将Pro式模型部署于64张H200,算力负载率约为135%,无法覆盖同等负载。换言之,V4.1 Flash并非使H200达到B300的峰值性能,而是通过减少每Token激活参数和计算量,将10T模型的算力需求降至H200的可承载区间。
图表5:10T模型理论算力匹配Benchmark
注:①集群有效算力按FP8 Dense峰值×64卡×40%有效算力折扣率测算。②聚合Token需求按512个在线会话、平均64K输入/1.5K输出、每300秒一次请求测算,对应约1.71次请求/秒、109K Prefill tokens/s和2.56K Decode tokens/s。③单Token计算量按约2×激活参数估算;107B/214B及306B均为按现有模型激活比例外推至10T模型的情景值,不代表实测结果。④该表仅用于验证算力容量量级,实际吞吐还受HBM带宽、MoE通信、batch、路由、调度及TTFT/TPOT要求影响。
资料来源:DeepSeek技术报告,NVIDIA官网,中金公司研究部
我们看到,国产AI芯片产品技术指标不断提升。我们通过对比华为、英伟达官方披露规格发现,昇腾960DT的单卡理论算力已进入H200同一量级,并在HBM容量与带宽方面占优。在华为全联接大会2026宣布,昇腾960DT将于2027年一季度就绪;据大会现场披露,昇腾960DT支持约2 PFLOPS FP8和4 PFLOPS FP4算力,最高配备288GB HBM,内存带宽达到9.6TB/s。作为对比,根据《NVIDIA H200 Tensor Core GPU产品白皮书》,NVIDIA H200 SXM的FP8稀疏Tensor算力为3,958 TFLOPS,折算至不计稀疏加速的稠密口径约为1.98 PFLOPS,并配备141GB HBM3e和4.8TB/s显存带宽。由此看,昇腾960DT的FP8理论峰值与H200基本相当,HBM容量和带宽则约为H200的2倍,为超大参数模型和长上下文推理提供了更充足的存储与访存资源。需要注意的是,上述比较仅针对理论峰值规格,实际模型性能仍取决于算子适配、互联效率、MFU及软件生态。
昇腾960超节点进一步解决了单卡之外的规模扩展问题。华为披露,单个昇腾960超节点最多可连接4,096张卡,通过灵衢实现统一内存编址,合计提供8 EFLOPS FP8、16 EFLOPS FP4算力;大会现场披露的总HBM容量达到1PB。华为将其明确定位于“加速十万亿规模大模型训练和推理”,根据华为全联接大会,相较上一代昇腾950,昇腾960超节点在10T模型场景下的训练MFU、训练吞吐和推理吞吐分别提升至约1.1倍、2.3倍和2.5倍,推理时延降低约70%。这表明,华为正通过“单卡性能提升+超节点高速互联+统一内存池”的系统级方案,构建面向10T模型的国产算力底座。
结合前文对DeepSeek V4.1 Flash的测算,国产10T模型部署的技术逻辑进一步闭环。V4.1 Flash通过CED、CSA2、FP4 KV和Engram等架构优化,将10T模型的单位Token计算量和KV缓存需求压缩至Hopper级硬件可承载区间;昇腾960DT的理论FP8算力对标H200,并通过4,096卡超节点解决大规模并行和内存扩展问题。因此我们判断,国产算力有望形成支持10T模型训练与推理的完整潜在技术路径;随着昇腾960DT计划于2027年进入交付阶段,相关能力有望从产品规划走向商业部署验证。
图表6:昇腾Atlas 960 SuperCluster 集群架构
资料来源:华为全联接大会2026,中金公司研究部
少算:重构Prefill路径并外置静态知识,降低单位Token的GPU计算量
CED(Causal Encoder-Decoder,因果编码器-解码器)通过重构Encoder-Decoder计算路径,显著压缩长上下文Prefill阶段的主干计算量。 DeepSeek V4.1 Flash将40层Transformer重构为20层Causal Encoder和20层Decoder。过去的Decoder-only架构中,长Prompt需要依次经过全部Transformer层,并在各层分别生成对应的KV;现在,CED先由Encoder完成长输入的主要处理,并基于Encoder输出的hidden states直接生成Decoder所需的Global KV,从而避免后20层Decoder再次对完整Prompt执行重复的全局计算。对于长上下文场景,当上下文长度远大于滑窗长度时,整体Prefill计算量接近减半。我们认为,相比V4 Flash的Decoder-only架构,CED构成一次代际级主干架构升级;从技术脉络看,该设计与微软亚洲研究院主导团队于2024年提出的YoCo(You Only Cache Once)架构具有相似思路,均通过集中生成全局KV并供后续模块复用,减少重复计算与KV缓存开销,DeepSeek进一步将该思路嵌入MoE、CSA2和SWA组成的长上下文架构体系。
深入来看,CED将长上下文Prefill拆分为“全量Encoder处理+局部Decoder重放”:前20层Causal Encoder处理全部历史Token,其输出用于生成可复用的Global KV;后20层Decoder仅处理近期Token,以重建SWA所需的Local KV。若精确恢复跨层SWA状态,理论上需要向前追溯约 (D\times W) 个位置,其中 (D) 为Decoder层数、(W) 为SWA窗口大小;以 (D=20、W=128) 为例,需追溯约2,560个Token。DeepSeek采用SWA Bounded Replay,将重放范围固定为最近128个Token,以有限的近似重计算换取固定开销,而更早的历史信息仍可通过Global KV读取。按token-layer(Token数×经过的模型层数)粗略估算,传统40层模型的Prefill工作量约为 (NL),CED则约为 (NL/2+WL/2);当 (N\gg W) 时,主体计算量接近减半。以 (N=32,768、L=40、W=128) 为例,两者分别约为131.1万和65.8万token-layer,后者约为前者的50.2%。
CED的优势在长上下文、频繁工具调用的Agent场景下更为明显。随着历史对话、工具返回结果和任务状态不断累积,Encoder负责处理长输入并生成可复用的上下文表示,Decoder侧仅需对近期窗口进行有限重放;同时,V4.1 Flash在Prefill和Decode阶段每Token分别激活约8B和16B参数,进一步降低输入侧的单位Token计算量。需要注意的是,token-layer下降接近50%并不意味着端到端GPU时间或实际FLOPs严格下降50%,实际收益仍受Attention、MoE、通信、内存带宽及调度效率等因素影响。对GPU产业链而言,CED降低了单次Agent任务的单位算力消耗,后续GPU总需求将更多取决于Agent渗透率、调用频次和Token Volume增长能否超过单位计算效率的提升。
图表7:CED架构重构Prefill路径,长上下文场景下推理计算量接近减半
资料来源:SemiAnalysis,DeepSeek-AI《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,中金公司研究部
Engram的核心思路是将部分稳定、重复出现的知识从Transformer和MoE的动态计算中剥离出来,改为通过独立的静态记忆模块进行检索。
EngramArchitecture(右图)展示条件记忆如何工作:模型根据输入中的局部词组进行N-gram检索,将命中的静态知识重新融合进当前隐藏状态。图左侧仍然保留Transformer、Attention和MoE主干,Engram只插入部分特定层;图右侧则展示其内部流程,模型先将连续两个或三个Token组合成局部词组,即2-gram和3-gram(gram表示由若干个连续Token组成的片段),再通过Hash函数将每个词组映射至固定的存储地址,通过Embedding Table找到对应记忆向量,再经过拼接、线性映射和上下文相关的融合机制,与当前模型状态结合。由于Engram的检索位置可以由输入token提前确定,系统能够在真正使用记忆数据之前完成预取:当GPU仍在计算前序网络层时,所需记忆向量已同步从Host CPU Memory向GPU搬运,从而使数据传输与模型计算并行进行,降低访存等待时间并提升整体硬件利用率。
图表8:DeepSeek-V4.1-Flash Engram 将静态知识外置,通过条件记忆降低主干计算负担
注:Engram通过N-gram哈希从静态条件记忆表中按需检索相关Embedding,并与主干网络Hidden States融合,从而将部分“记忆”能力从持续参与计算的Transformer参数中剥离。推理阶段,Engram记忆表可部署于Host Memory,并通过RDMA预取到GPU侧与主干计算并行执行,实现“外置存储、按需调用”,在扩展模型知识容量的同时降低单位Token的GPU动态计算压力。
资料来源:DeepSeek-AI《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》,arXiv:2601.07372,中金公司研究部
我们认为,Engram对硬件成本最直接的影响,是将部分知识存储从昂贵的GPU HBM转移到容量更大、单位成本更低的Host CPU DRAM,从而提高HBM的使用效率。对于硬件产业链而言,这一架构也提高了大容量服务器DRAM、企业级SSD、PCIe/CXL接口及相关控制芯片在AI服务器中的价值量,为DRAM、SSD和互联芯片提供更多参与AI基础设施升级的空间。
我们认为,Engram的另一项重要价值,是让更小的动态计算规模获得接近甚至超过更大模型的能力,从而降低单位token的计算资源和能源消耗。DeepSeek-V4.1-Flash的backbone参数量为552B,显著低于V4-Pro的1.6T;实际每个token的激活参数差距更大,V4.1-Flash在Prefill/Decode阶段分别约为8B/16B,而V4-Pro的激活参数约为49B。尽管动态计算规模明显更小,DeepSeek官方披露V4.1-Flash在多项测试中已经达到或超过V4-Pro,并据此计划逐步下线V4-Pro。其中一个重要原因就是Engram将部分“知识容量”从高成本的动态参数中独立出来,使模型不必单纯依靠扩大Transformer/MoE主干来保存更多知识,因此可以减少每个token需要参与矩阵计算的参数量,提高单卡吞吐,并降低单位token的计算和能耗成本;对于高频API、Agent等推理场景,其经济性提升尤其明显。Engram并非随V4.1 Flash临时出现的新概念。DeepSeek团队早在2026年1月发布的论文《Conditional Memory via Scalable Lookup》中便系统提出Engram,并验证了其能力与部署效率;至2026年9月,团队进一步将其集成至V4.1 Flash。这一过程体现出DeepSeek从前沿研究、架构验证到商业化模型落地的持续转化能力。
少存:通过跨层复用、低精度压缩与按需重算,全面降低HBM、DRAM及SSD中的KV缓存占用
CSA2(Compressed Sparse Attention 2,第二代压缩稀疏注意力)通过跨层复用Global KV和索引结果,减少不同Transformer层重复保存和查询长上下文信息。传统Sparse Attention虽然只关注部分历史Token,但不同层仍可能分别保存Global KV并重新执行索引;V4.1 Flash的CSA2将层分为Full、Reindex和Reuse三种模式,其中Full层完整生成Global KV和Top-K索引,Reindex层复用已有Global KV、仅重新选择Top-K,而Reuse层进一步同时复用Global KV和Top-K结果,使后续层无需重复生成和保存相同的全局缓存。
CSA2进一步通过Hierarchical Sparse Indexer缩小长上下文的搜索范围,同时简化原有CSA的压缩与索引路径。 首个Full层在完整上下文中筛选候选区域,后续Reindex层仅在较小的candidate pool中重新寻找Top-K,使深层Indexer无需随着上下文长度增加而持续扩大搜索范围;同时CSA2取消CSA中部分重叠压缩和独立Indexer K生成路径,使Global KV缓存、索引计算和训练实现进一步简化。
从硬件与商业化逻辑看,CSA2主要降低长上下文推理对HBM容量和内存带宽的需求,并提升单卡Agent并发能力。 长上下文下Global KV是runtime KV Cache的主要组成部分,并直接受HBM容量约束;跨层共享KV意味着同样上下文不再需要每层保存一套完整Global KV,从而降低单位Token对应的HBM缓存占用和KV读写量。需要注意,官方披露的Global KV约降至V4 Flash的1/4是 CSA2与FP4 KV等优化共同作用的结果,不能全部归因于CSA2,我们在后文中会继续分析。
图表9:CSA2的三种运行模式
注:CSA2将不同Transformer层对长上下文的存储与检索进行分工:少数Full层负责生成Global KV和索引结果,Reindex层复用KV后重新筛选相关历史,Reuse层进一步复用KV与Top-K,从而减少跨层重复存储和重复检索。其中:Main KV = 长上下文的“资料库”;Top-K indices = 当前最值得看的“重点目录”;Main Q = 当前这一层提出的问题;SWA KV = 最近一小段局部上下文。
资料来源:DeepSeek-AI《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,中金公司研究部
FP4 Main KV通过降低KV Cache的数据精度,进一步压缩每个Token对应的缓存存储量。DeepSeek V4的Main KV主要采用FP8,而V4.1 Flash将量化训练扩展至Main KV Cache,以约4-bit格式保存Global KV;其作用主要不是降低矩阵乘计算,而是直接减少KV存储空间。官方披露FP4 Main KV相较V4的FP8 Main KV可使这部分缓存占用接近减半,并同时作用于HBM中的runtime KV以及offload后的存储。
SWA Bounded Replay则通过“少存短期缓存、需要时少量重算”,减少SWA KV对长期持久化存储的占用。V4需要长期保存各层的SWA KV,否则精确恢复时要逐层向前回算,计算量约为“模型层数 L× 滑动窗口长度 nwin”。V4.1则不再将SWA KV长期写入Persistent KV Cache(Persistent KV Cache是将可复用的历史Token计算结果长期保存在Host CPU DRAM或SSD中,供后续多轮请求直接调用、避免重复计算的缓存);当缓存缺失时,只重算最近一个窗口,即约128个Token,近似恢复所需的SWA状态。Decoder侧同样在每次Prefill时只回放最近128个Token。通过以少量计算替代长期存储,V4.1将Persistent KV Cache压缩至V4-Flash的约1/8。
从硬件与商业化逻辑看,这组优化直接降低了长上下文Agent对HBM、Host DRAM和SSD容量及数据搬运的需求。 FP4主要减少Global KV单条记录的体积,降低HBM与offload存储占用;SWA Bounded Replay则不再将各层SWA KV作为持久化缓存写入SSD,而是在恢复缓存前缀时,仅重放最近一个滑动窗口内的Token以近似重建SWA状态,从而以少量重复计算换取SSD及Host Memory存储需求的下降。仅在Host CPU Memory中进行短期管理,并在缺失时以少量计算恢复。最终效果是单位Agent请求需要长期保存和搬运的KV数据显著减少,从而降低DeepSeek的存储、I/O和部署成本,同时提高相同存储资源下可服务的长上下文用户数量。长上下文KV原本正是HBM、Host CPU Memory、SSD和互联带宽的重要约束之一。
图表10:DeepSeek各代模型单Token对应的Global KV Cache大小(单位:字节)
注:反映了DeepSeek持续降低上下文存储需求的优化方向。与DeepSeek-V4-Flash和DeepSeek-V1相比,DeepSeek-V4.1-Flash的单Token Global KV Cache大小分别降低约4倍和437倍。
资料来源:DeepSeek-AI《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,中金公司研究部
少搬、快生:Single-Pass mHC + DSpark降低显存访存并提升单位GPU Decode吞吐
Single-PassmHC主要针对大模型内部的信息传递机制进行优化,核心目标是让不同网络层之间的信息利用更加充分,同时保持深层模型训练的稳定性。传统Transformer普遍采用残差连接,即每一层在完成计算后,将本层输出与原始输入直接相加。这种结构简单、稳定,但不同层之间的信息交互方式相对固定。Hyper-Connections(HC)将单一路残差信息扩展为多路状态,并通过Pre Mapping、Res Mapping和Post Mapping三类映射,分别控制当前层如何读取信息、残差信息如何继续传递,以及本层输出如何重新写回残差通道,即图中从a至b。mHC则在此基础上加入约束机制,使多路信息在跨层混合时保持稳定,避免深层网络中信号过度放大或衰减,即图中由b至c。
图表11:Residual Connection、Hyper-Connections(HC)与mHC结构演进
注:标准Residual Connection仅保留单一路径的残差信息;Hyper-Connections(HC)将残差流扩展为多路,并通过Pre、Res和Post Mapping对不同残差流进行动态混合;mHC进一步将映射矩阵投影至受约束流形,在保留多路信息传递能力的同时提升训练稳定性。DeepSeek V4.1在此基础上进一步引入Single-Pass mHC,通过调整mixing coefficient的依赖关系并结合Mega-mHC Kernel Fusion,减少Activation重复读写,降低显存访存开销。
资料来源:DeepSeek-AI技术论文《mHC :Manifold-Constrained Hyper-Connections》,arXiv:2512.24880,中金公司研究部
Single-Pass进一步解决了复杂连接结构带来的执行效率问题。简单来说,mHC负责提升跨层信息利用能力,Single-Pass则负责让这种更复杂的连接结构能够以更高效率运行。
我们认为,Single-PassmHC的价值主要体现在提升模型能力的同时控制额外计算和访存成本。对于大模型而言,单纯增加网络深度或连接复杂度往往会带来更高的显存占用和更低的硬件利用率,Single-Pass通过减少重复的数据搬运和中间状态访问,可以降低这一部分额外开销。因此,其增效主要来源于提升单位GPU-hour和单位显存带宽所能够完成的有效计算量,从而提高训练和推理过程的整体效率。对于硬件来看,Single-PassmHC有利于缓解大模型对HBM带宽的压力。Single-Pass减少模型中间计算结果在显存中的重复读取和写回,可以提高现有HBM带宽的有效利用率。与Engram类似,Single-Pass mHC也建立在DeepSeek此前的研究积累之上:团队于2025年12月发布mHC论文,V4.1 Flash进一步将原有mHC升级为Single-Pass实现,并通过Mega-mHC Kernel将激活值内存流量降低约50%,这又一次体现了DeepSeek将既有学术成果持续迭代并兑现至商业化模型的能力。
DSpark主要优化大模型的Decode阶段,即模型持续生成token的过程,其核心目标是减少大模型重复执行推理的次数,提高单次计算能够确认的有效token数量。
DSpark对这一过程进行了两方面优化:一方面提高候选token的连续性,另一方面动态决定哪些token值得被验证。
图表12:DSpark通过半自回归草拟与置信度调度提升Decode效率
注:DSpark采用推测解码机制,先由Target Model生成锚点Token,再由轻量Draft模块通过Parallel Block并行生成多个候选Token,并由Sequential Block补充Token间依赖;Confidence Head预测各候选Token的接受概率,Hardware-Aware Prefix Scheduler结合置信度与硬件吞吐特征动态确定验证长度,最后由Target Model并行验证候选前缀。该机制通过“低成本批量草拟+ 主模型并行验证”减少主模型逐Token生成次数,从而提升Decode阶段单位GPU吞吐。
资料来源:DeepSeek-AI技术论文《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》,arXiv:2607.05147,中金公司研究部
我们认为,DSpark的增效主要来自提高有效验证率,降低单位token的推理成本。传统投机解码中,如果后续候选token质量较低,大模型仍然需要消耗计算资源进行验证,最终却只能接受前面少量token。DSpark通过引入Sequential Block和Confidence Head,提高候选token的质量,同时利用Scheduler(Scheduler即调度器,负责根据置信度和当前硬件负载,决定哪些候选token值得送进大模型验证)缩短低置信度的候选序列,减少无效验证。这样,在相同GPU数量下提高生成速度和整体吞吐,也能够在高并发场景中服务更多请求。对于云厂商和模型API厂商而言,这意味着相同算力投入可以产生更多可计费token,从而降低单位token的边际推理成本。从成本角度看,DSpark的核心影响是提升现有GPU集群的有效利用率。由于低质量候选token会被更早裁剪,目标模型需要处理的无效计算、KV Cache操作和部分数据传输都会减少,因此GPU计算资源和显存资源可以更多用于真正能够被接受的token。我们认为,这将使服务器硬件评价标准更加重视实际serving throughput、KV Cache管理能力以及推理软件栈效率。
风险提示
► 模型价格竞争风险。DeepSeekV4.1Flash等高性价比模型可能推动国内外模型厂商进一步下调API价格。若由此带来的调用量增长没有超过模型价格下降,模型厂商和云计算厂商的收入及利润可能承压,并影响其后续资本开支意愿,进而削弱国产算力产业链的需求增量。
► 硬件供应链风险。国产算力芯片、服务器及高速互联设备仍受到先进制程、HBM、高速接口芯片和关键设备供应能力的制约。若关键环节出现供应不足、交付延期或成本上升,可能影响国产算力集群建设进度,并导致相关公司的收入确认和盈利能力低于预期。
► AI商业化风险。当前AI需求仍有较大部分来自基础设施建设、模型训练和试点项目。如果Agent及企业级AI应用的付费意愿、使用频率和投资回报率不及预期,低成本模型带来的调用量增长可能不足以形成稳定现金流,最终导致云厂商和互联网公司的算力采购及资本开支放缓。
Source
文章来源
本文摘自:2026年9月22日已经发布的《AI进化论(23):DS V4.1 Flash释放硬件潜能,国产卡迈向10T模型时代》
成乔升 分析员 SAC 执证编号:S0080521060004
于新彦 分析员 SAC 执证编号:S0080524080007
陈昊 分析员 SAC 执证编号:S0080520120009 SFC CE Ref:BQS925
贾顺鹤 分析员 SAC 执证编号:S0080522060002
彭虎 分析员 SAC 执证编号:S0080521020001 SFC CE Ref:BRE806
Legal Disclaimer
法律声明
特别提示
本公众号不是中国国际金融股份有限公司(下称“中金公司”)研究报告的发布平台。本公众号只是转发中金公司已发布研究报告的部分观点,订阅者若使用本公众号所载资料,有可能会因缺乏对完整报告的了解或缺乏相关的解读而对资料中的关键假设、评级、目标价等内容产生理解上的歧义。订阅者如使用本资料,须寻求专业投资顾问的指导及解读。
本公众号所载信息、意见不构成所述证券或金融工具买卖的出价或征价,评级、目标价、估值、盈利预测等分析判断亦不构成对具体证券或金融工具在具体价位、具体时点、具体市场表现的投资建议。该等信息、意见在任何时候均不构成对任何人的具有针对性的、指导具体投资的操作意见,订阅者应当对本公众号中的信息和意见进行评估,根据自身情况自主做出投资决策并自行承担投资风险。
中金公司对本公众号所载资料的准确性、可靠性、时效性及完整性不作任何明示或暗示的保证。对依据或者使用本公众号所载资料所造成的任何后果,中金公司及/或其关联人员均不承担任何形式的责任。
本公众号仅面向中金公司中国内地客户,任何不符合前述条件的订阅者,敬请订阅前自行评估接收订阅内容的适当性。订阅本公众号不构成任何合同或承诺的基础,中金公司不因任何单纯订阅本公众号的行为而将订阅人视为中金公司的客户。
一般声明
本公众号仅是转发中金公司已发布报告的部分观点,所载盈利预测、目标价格、评级、估值等观点的给予是基于一系列的假设和前提条件,订阅者只有在了解相关报告中的全部信息基础上,才可能对相关观点形成比较全面的认识。如欲了解完整观点,应参见中金研究网站(http://research.cicc.com)所载完整报告。
本资料较之中金公司正式发布的报告存在延时转发的情况,并有可能因报告发布日之后的情势或其他因素的变更而不再准确或失效。本资料所载意见、评估及预测仅为报告出具日的观点和判断。该等意见、评估及预测无需通知即可随时更改。证券或金融工具的价格或价值走势可能受各种因素影响,过往的表现不应作为日后表现的预示和担保。在不同时期,中金公司可能会发出与本资料所载意见、评估及预测不一致的研究报告。中金公司的销售人员、交易人员以及其他专业人士可能会依据不同假设和标准、采用不同的分析方法而口头或书面发表与本资料意见不一致的市场评论和/或交易观点。
在法律许可的情况下,中金公司可能与本资料中提及公司正在建立或争取建立业务关系或服务关系。因此,订阅者应当考虑到中金公司及/或其相关人员可能存在影响本资料观点客观性的潜在利益冲突。与本资料相关的披露信息请访问http://research.cicc.com/disclosure_cn,亦可参见近期已发布的关于相关公司的具体研究报告。
本订阅号是由中金公司研究部建立并维护的官方订阅号。本订阅号中所有资料的版权均为中金公司所有,未经书面许可任何机构和个人不得以任何形式转发、转载、翻版、复制、刊登、发表、修改、仿制或引用本订阅号中的内容。