阅读,与值得关注的内容Readance

DeepSeek订购16万片华为昇腾950DT,华为2030年能追上英伟达吗?

彭博社报道 DeepSeek 计划在内蒙古乌兰察布新建的数据中心,部署至少16万片华为昇腾950DT芯片。若顺利落地,这将是目前已知规模最大的华为AI芯片集群之一,也是中国加速国产算力替代的又一标志性动作。

这座数据中心目标规模达到约1吉瓦(GW),属于“东数西算”工程的重要节点。内蒙古拥有丰富的绿电资源和天然冷源优势,电价相对较低,非常适合大规模AI算力布局。DeepSeek计划自建一部分算力,同时从当地运营商租赁额外资源,整体形成超大规模集群。

关键点在于芯片用途:这批950DT主要用于模型推理(运行/服务),而非训练。DeepSeek此前尝试过用华为芯片训练模型,但核心训练环节至今仍主要依赖英伟达硬件。华为将950DT定位为可支持训练的高性能芯片,但DeepSeek当前选择“训练用英伟达、推理用华为”的分工策略。

公开信息显示,昇腾950DT配备约144GB高带宽内存,内存带宽约4TB/s,与英伟达H200的141GB/4.8TB/s接近。部分分析认为,在推理任务上它已具备较强竞争力,整体水平大致对标英伟达Hopper世代的部分产品。不过,单卡绝对性能、生态成熟度和软件栈完备度上,与英伟达最新旗舰仍有差距。

16万片的规模已经相当可观。如果全部到位,将显著提升DeepSeek的国产推理算力储备,也有助于验证华为昇腾在大规模集群中的实际表现。

消息同时指出,华为今年昇腾950DT产量预计仅在数十万片量级,主要受高端HBM等高端存储等关键部件短缺制约。华为还需兼顾其他客户需求,并尝试少量出口,因此完整交付DeepSeek这批订单可能需要一年以上时间。部分产能或分批到位,目标是在2027年底至2028年初让部分算力投入运行。

这也从侧面印证了当前国产高端AI芯片的现实:技术进步很快,但规模化供应仍受制于供应链。

我们梳理了华为的芯片路线图与供应链情况,涵盖昇腾 950、其押注的 3D 堆叠技术以及国产高带宽内存(HBM)供给。经测算:2026 年华为 AI 总算力规模不足英伟达的 4%;若完全依靠国产 HBM,到 2028 年这一占比或将跌至仅 1%。

Image

我们对比华为与英伟达的核心指标是双方产出的总算力,该数值取决于 AI 硬件的算力吞吐能力,以及芯片量产规模。华为在这两方面均落后于英伟达,而美国出口管制进一步制约了它改善两项短板的空间。

当前华为芯片相比英伟达存在 3‑4 年代差。今年量产交付的华为旗舰昇腾 950 系列,FP8 算力为 1PFLOP/s,大约只有英伟达 2022 年就已出货的 H100 的一半。英伟达 B300 的 FP4 性能是昇腾 950 的 7 倍。

Image

单芯片层面,英伟达对华为的性能差距还在持续拉大。目前二者性能差距为 7 倍;待英伟达推出 Rubin 与 Rubin Ultra 之后,瞬时性能差距或将扩大至约 17.5 倍。

Image

既然单芯片性能追不上英伟达,华为能否靠更大的芯片出货量弥补差距?答案几乎是否定的。华为眼前的瓶颈并非逻辑芯片制造:中芯国际能够生产的昇腾裸芯片数量,已经超过国内可以完成封装成品的数量。真正的卡点是高带宽内存 HBM—— 所有 AI 芯片必需的堆叠式内存。

长鑫存储与紫光存储器的国产 HBM 刚刚进入扩产爬坡阶段,但华为还有其他获取渠道:2024 年 12 月出口管制落地前囤积的超过 1000 万片海外 HBM 堆叠芯片、持续的海外采购渠道,以及走私流入的 HBM。

综合全部内存来源测算,2026 年华为昇腾芯片出货量约 150 万片,几乎是 2025 年的两倍:其中 75 万片采用 LPDDR 内存的 950PR,43 万片 910C,32 万片 950DT。

Image

即便今年出货达到 150 万片,折算为 H100 等效算力仅约 90 万卡,而英伟达约为 2300 万卡,华为总算力依旧不到英伟达的 4%。就算取对华为最乐观的估算,占比也仅在 6% 左右。

Image

华为 2024 年囤积的海外 HBM 库存将在 2026 年消耗殆尽。如果此后只能完全依赖国产 HBM,测算显示,直至 2028 年,华为 AI 总算力大约仅为英伟达的 1%。

Image

若改用内存带宽作为统计口径,差距会有所收窄:2028 年华为等效 H100 规模可达 280 万卡,约占英伟达的 3%。

Image

为什么算力差距如此悬殊?对比仅使用国产 HBM 条件下,英伟达与华为的供给差异:2026 年英伟达获得的 HBM 晶圆供给是华为的 32 倍;单片晶圆产出可用内存是华为的 2.3 倍;每 GB 内存可搭配的算力更是华为的 2.7 倍;三项相乘综合差距接近 200 倍。

Image

到 2028 年,随着长鑫存储 HBM 产能爬坡,华为在晶圆供给上和英伟达的倍数差距从 32 倍缩小至 7.3 倍。但芯片设计层面差距继续扩大:预计 2028 年英伟达以 Rubin Ultra 为主力的产品组合,每 GB 内存承载的算力将达到昇腾 960 的 9 倍。综合算力差距虽有收窄,但仍有约 100 倍。

Image

走私 HBM 能多大程度弥合差距?做一个极端假设:2028 年华为走私获得的 HBM 达到国产供给的 10 倍,这是极难实现的规模,至少需要投入 400 亿美元成本。在此前提下,华为等效 H100 算力可从 100 万卡提升至约 1100 万卡,但也仅相当于当年英伟达产能的 11%。

中国 HBM 供给与华为芯片本身都会快速进步,但增速大概率不足以实现追赶。即便到 2030 年国内 HBM 总产能提升 18 倍,华为总算力也只能达到英伟达 2028 年产量的 12%‑18%。

针对单芯片性能短板,华为推出名为 LogicFolding(逻辑折叠)的 3D 堆叠技术。该技术不再追求制造更小的晶体管,而是将逻辑芯片垂直堆叠;目标是基于 5nm 级别裸芯片,在 2031 年实现等效 1.4nm 工艺的晶体管密度。不过 LogicFolding 技术最早也要到 2030 年才会落地到昇腾芯片。

与此同时,英伟达也不会原地踏步。2030 年前,SK 海力士、三星、美光预计将投入数千亿美元扩建晶圆厂。英伟达下一代 Feynman 相比 Rubin 会带来大幅性能跃升;到 2030 年,英伟达甚至可能已经推出 Feynman 的后续迭代产品。

出口管制并未完全阻断华为技术进步,但让追赶之路变得更加艰难、周期更长、成本更高。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →