阅读,与值得关注的内容Readance

DeepSeek押注华为训练芯片,国产算力开始进入模型训练

DeepSeek押注华为训练芯片,传递出的信号落在模型训练环节。报道显示,DeepSeek正把国产芯片推进到模型训练。供货规模、软件适配和训练稳定性,将决定这条路线能走多远。

 

图:The Information 报道标题与导语,报道将 DeepSeek 使用国产芯片训练模型与华为训练芯片交付联系起来。

01

训练芯片成为合作的下一站。

X 帖转发的报道写得很直接:DeepSeek CEO 梁文锋告诉投资者,增加国产芯片训练模型是公司的重要目标。报道援引两名知情人士称,华为最早可能在 2026 年第四季度向 DeepSeek 交付训练芯片。

这里的关键词是“训练”。推理阶段只需让已经完成的模型生成答案;训练阶段要反复处理海量数据,持续完成参数更新,还要让成千上万张芯片保持高效通信。芯片算力、显存、互联、编译器和软件框架会一起影响训练进度。

华为在 2025 年公布的 Ascend 950 路线中,把 950DT 定位为面向解码和模型训练的芯片。官方计划在 2026 年第四季度供应。这个时间点与报道中的交付预期相互对应。报道没有披露 DeepSeek 将获得的具体型号、数量和训练占比。

 

图:报道页面截图。可见标题、作者、发布日期和导语;截图中的人物照片与报道正文无关,本文不据此判断人物身份。

02

从适配模型到共同调试基础设施。

DeepSeek 过去已经把国产芯片带进模型运行环节。2026 年 4 月发布的 V4 预览版,被公开报道为适配华为 Ascend 芯片运行;随后又出现华为芯片参与 V4 Pro 后训练的报道。模型方需要重写算子、调整并行方式,并反复测试不同硬件上的输出和速度。

训练阶段的合作会把这条链路再向前推一步。芯片供应商要面对模型架构的实际需求,模型团队也要围绕芯片的内存、通信和软件栈重新安排训练方法。双方共同调试的对象,已经从单个模型的部署适配扩展到训练系统本身。

这也是报道中“摆脱美国出口管制影响”这句话的具体含义。依赖国产芯片训练,减少的是关键训练环节对受限供应链的暴露;它带来的现实压力,则是国产硬件需要承担更长的训练周期、更复杂的软件迁移和更高的工程维护成本。

一个需要分开的口径:华为公布的是芯片路线和供应时间,The Information 报道的是 DeepSeek 的采购与训练计划。公开材料没有给出 DeepSeek 新模型究竟有多少训练工作负载会放在华为芯片上。

03

大模型尺寸只是表面,供货与稳定性才是硬约束。

帖主还提到一个约 2T 参数的 DeepSeek 模型,以及计划中的 8T 模型。这个数字目前来自帖主对报道和相关信息的转述,公开来源没有披露完整的模型路线、训练开始时间或最终发布安排。它可以说明训练需求可能继续上升,却不能直接当作产品发布计划。

模型越大,训练所需的计算、存储和通信资源越重。芯片“能跑起来”与“适合大规模稳定训练”之间,隔着集群规模、故障恢复、软件工具链和持续供货。华为 950DT 的路线给出了产品时间表。DeepSeek 的计划提出了真实训练场景。真正的结果,要等两者在集群中长期运行后才会显现。

报道还提到,DeepSeek 正在推进第二轮融资,目标金额约 500 亿元人民币,估值约 5000 亿元人民币。资本规模会影响算力采购和工程团队建设,但资金本身无法替代芯片供货、编译器成熟度和训练效率。

如果合作继续向训练环节深入,观察重点会落在三个结果。训练芯片能否按期交付,模型代码能否稳定迁移,同等训练任务的时间和故障率能否接受。国产算力从“支持模型运行”走到“支撑模型训练”,分界线就在这些工程结果里。

来源:The Information;Huawei 官方 Ascend 950 路线说明;Reuters 关于 DeepSeek 芯片与华为适配的报道;DeepSeek V4 公开发布资料。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →