阅读,与值得关注的内容Readance

华为昇腾960提前9个月上市,中国AI硬件产业链正在重做一遍

一颗芯片追不上英伟达,中国开始用 HBM、封装、光互联、存储和百万卡系统,换一种打法

硅基时间产业洞察 · 2026-09-17

华为轮值董事长汪涛在华为全联接大会讲完昇腾 960 提前就绪,接下来十几张 PPT 没有一张是芯片:光引擎、统一总线、100T 交换机、4,096 卡超节点、百万 NPU 集群、KV Cache 存储、96kW 液冷机柜。华为不是在发布一颗芯片,它是在把 AI 计算机从头到尾重新做一遍——竞争的基本单位从芯片换成了系统,中国的产业地图也从「国产 GPU 替代」扩成了一整条新链条。


一、路线图之后,还有十张 PPT

9 月 17 日,上海,华为全联接大会。展馆人满为患,主会场外排着长队,展区里国际参观者的密度比往届高得多。这个细节本身就是信号:来的人想知道,华为的芯片怎么追上英伟达,接下来打算怎么办。

先看路线图。960DT,2027 年一季度,比原计划提前三个季度;960PR,2027 年三季度,提前一个季度;970,2028;980,2029。此后一年一代¹。汪涛同时披露:昇腾超节点已部署超过 1,000 套(以 910C 为主),950 超节点已规模商用²。

华为接着发的是 Hi-ONE 光引擎、灵衢 UnifiedBus、100T UBG 交换机、4,096 卡的 Atlas 960E 超节点、100 万 NPU 的 Agentic 超节点集群、OceanStor M900 记忆存储、鲲鹏 950 通算超节点,以及一个 96kW 的液冷机柜³。

一颗芯片的发布会,不需要讲交换机和冷却液。华为讲了,因为它要交付的东西变了。汪涛的原话是:华为 AI 战略的核心是算力,"坚持硬件变现"¹⁸

AI 竞争的基本单位,正在从一颗芯片变成一台计算机。

这句话是理解今天这场发布会、也是理解未来三年中国 AI 硬件产业的一把钥匙。

先把三个词说清楚:芯片,一颗 NPU;计算机,华为叫超节点,几千颗 NPU 连成逻辑上的一台,程序看到的就是一台机器;工厂,几百台超节点连成集群,再加上给它供电、散热、喂内存的整条产业链,产品是 Token——英伟达叫它 AI Factory。这篇文章的顺序,就是从芯片讲到计算机,再从计算机讲到工厂。



二、一颗芯片追不上,就重新定义「一台计算机」

中国 AI 芯片的基本现实没有变:把先进制程、HBM、封装、软件生态全部算进去,单颗芯片与英伟达最先进产品仍有差距。

华为选的路线是:既然一颗芯片短期追不上,就不只比一颗芯片。

现场最让我印象深刻的一张图是 Atlas 960E SuperPoD(官方通稿称「昇腾 960 超节点」):4,096 NPU 统一内存编址,全域 D2D RTT 2 微秒(华为 PPT 原始口径),2027 年三季度上市⁴。去年全联接把 Atlas 960 SuperPoD 说成最多 15,488 卡、30 EFLOPS,今年收成 4,096 卡、8 EFLOPS(FLOPS 是每秒浮点运算次数,芯片算力的峰值口径;1 PFLOPS 是每秒一千万亿次,1 EFLOPS 是它的一千倍;)

这不是简单缩水,而是产品边界重划:Scale-up 的“单台逻辑计算机”收敛到 4K NPU,更大的规模交给 Scale-out。这已经不是「4,096 台服务器联网」,它要做的是把几千颗 NPU 在逻辑上变成一台计算机:单超节点 8 EFLOPS FP8,HBM 容量 1PB。

华为给了这条路线一个定量依据。现场一张仿真曲线:MoE 模型越大越稀疏,通信占训练时间的比例越高——1.6T 模型、1.6 万卡时是 18%,10T 模型、10 万卡时到 44%。通信占的时间,就是芯片空转的时间;衡量它的指标叫 MFU,模型算力利用率——峰值算力里真正用在训练上的比例。
同一条件下,4K 超节点的 MFU 约 31%,8 卡服务器约 11%,差 2.75 倍²⁶。FLOPS 是说明书上的马力,MFU 才是里程表上的数。单卡性能落后多少是一道题,十万张卡里有多少时间真正用于计算是另一道题——华为选择解决第二道题。
图 1 「一台计算机」的边界从一颗 CPU 长到百万 NPU;单卡追不上,就在系统层补回来。来源:华为全联接大会 2026

这个方向在 950 上已经落地⁵。单柜把 64 颗昇腾 950DT、16 颗鲲鹏 950、互联、IO、供电和散热紧耦合在一起,CPU 和 NPU 按 2:8 组成逻辑计算节点。报道特别指出,这个设计的目的是让 CPU、NPU 和互联在逻辑上作为一个整体执行训练和推理,而不只是往柜子里多塞芯片⁶。

展区里的 Atlas 950 SuperPoD 真机:1,024 卡,256TB 统一内存编址。摄影:蒋涛
几千颗 NPU 能不能高效协作,决定单卡性能有多少能真正变成系统性能。华为赌的是,在系统这一层,它能把单芯片的落差补回来。

三、先进制程之外,中国最缺的可能是 HBM

再看路线图上的另一组数字⁷。

图 3 算力持续翻番,内存带宽两年提升 4 倍:HBM 正成为另一道关键瓶颈。

真正困难的地方可能在 FLOPS 之外:这么大的容量和带宽从哪里来。答案绕不开 HBM。

过去谈国产 AI 芯片,注意力都在 7 纳米、5 纳米、3 纳米落后多少。但 AI 芯片已经变成三件东西的组合:Compute Die、HBM、先进封装。缺任何一块,另外两块都发挥不出来。

HBM 的问题不只是技术,还有产能。SK 海力士、美光等主要供应商正在通过多年期协议提前锁定大量未来内存供应。这意味着中国面对的约束出现了两层:第一层是政策面的出口管制,最先进的买不到;第二层是市场面的产能挤占,即使允许卖,未来新增产能也早已被美国科技巨头大客户订走

以前的限制是「不能卖给你」,现在多了一层:「等你想买时,产能已经被别人订走了」。

后一层比前一层更难对付:技术突破解决不了它,它要的是产能、资本和长期订单。

这决定了国产供应链补课的先后,也是大买家下单、投资人下注该盯的顺序。NAND 可以买,DRAM 厂不必自建,HBM 不能等:设计、接口、封装、可控供应,缺一样,国产 GPU/NPU 做得再快也卡在内存墙上。它是最先要拿下的一环;接口、良率、产能爬坡哪一样掉队,先后才需要重排。

这一环的分工今天已经看得见:华为自研的 HBM(950 用的 HiBL、HiZQ)管规格和接口,裸片要靠长鑫——国内唯一做 HBM 裸片的厂,HBM3 样品已交到华为手上,2026 年冲量产,12 层 HBM3E 计划 2027 年²⁴。960DT 的 288GB、9.6TB/s 正是 8 颗 12 层 HBM3E 的规格,和长鑫的时间表几乎贴着:960 能不能按量出货,要先看长鑫的良率。


四、芯片里面靠封装,芯片外面靠光

先进制程短期不能同代竞争,还有没有别的办法?有。华为这场发布会给了两个答案:芯片里面靠先进封装,芯片外面靠高速互联

封装过去被当作半导体的「后道」。AI 改变了这件事。当 Compute Die、HBM、I/O Die 越贴越近,封装开始决定带宽、延迟、功耗、散热和良率。它从「把芯片装起来」变成了延续摩尔定律的一种方式。以后衡量一颗 AI 芯片,不能只问几纳米,还要问:几个 Compute Die,多少 HBM,多大内存带宽,什么封装,Die-to-Die 带宽多少。芯片本身已经是一个小系统。

芯片外面,是光。现场另一张 PPT 的价值不低于 960:Hi-ONE NPO 光引擎,华为称这是业界首个量产、也是传输能力最大的近封装光引擎⁹。落到 960 超节点上:5,500 个 Hi-ONE 替代原本需要的 48,000 颗 800G 光模块,功耗降低 550 千瓦以上,系统可用度 99.8%¹⁸。

图 4 光引擎贴到主芯片旁边,超节点内可插拔光模块从 48,000 个降到 0;光模块从网络设备变成 AI 计算机的总线。来源:华为全联接大会 2026

华为要解决的问题很朴素:几千、几万颗芯片连在一起以后,纯电互联开始碰到功耗、距离和信号完整性的边界。距离越远、速率越高,铜越吃力,光就不断向芯片靠近——过去是机柜之间走光,后来是板卡之间走光,NPO/CPO 时代是芯片之间走光。华为把这条原则叫「近铜远光」。

图 5 950 超节点机柜背面,成束的光纤跳线仍要靠人手一根根插好;960E 要把这些光模块全部收进芯片旁边,归零。摄影:蒋涛

这件事对中国尤其重要。中国在全球 AI 产业链里最弱的是先进逻辑制程,过去二十年积累最深的能力之一恰恰是通信:光器件、光模块、交换机、光纤,产业基础完整。

过去二十年为互联网修路的中国通信产业,正在搬进 AI 计算机的内部。

光模块过去是「网络设备」,未来越来越像 AI 计算机的总线。AI 硬件的价值,正在从 GPU 向光扩散。


五、交换机也不再只是交换机

下一张更激进:灵衢 UnifiedBus 加两层 CLOS 组网,打造 100 万卡集群。单平面 32k,多平面到 1,024k;面向超节点集群的 100T 级 UBG 交换机,1,024 大 Radix,华为规划 2027 年四季度(现场 PPT)¹⁰。

华为做了两层架构。第一层 Scale-up:4,096 颗 NPU 组成一个超节点,追求极低延迟、极高带宽和统一内存寻址,让它们尽可能像一台机器。第二层 Scale-out:把大量超节点用 CLOS 网络连起来——两层 CLOS 四平面到 51.2 万卡,再加多轨道拓扑到 100 万卡¹¹ ¹⁸。

图 6 4,096 卡超节点乘以约 250 个,就是 100 万 NPU;Fabric 的利用率是整座工厂并行系数的上限。来源:华为全联接大会 2026,对比为华为口径

这时候交换机是什么?过去,交换机就是网络;现在,交换机是计算机的一部分。

这些数字为什么重要?如果几万颗 NPU 大量时间都在等通信,理论 FLOPS 再高也没有意义。Fabric 的效率直接决定理论算力能变成多少有效算力。放回硅基时间的公式,Fabric 就是并行系数的物理上限。利用率下降多少会损失多少有效算力,取决于模型结构、并行策略和 batch 等具体条件;但规模越大,通信等待对硅基时间产出的影响就越不能忽略。

这恰好是华为最值得观察的地方。先进制程是它的约束,通信却是它几十年的长板。当 AI 从单芯片走向万卡、百万卡,通信第一次从「计算机外面的网络」进入「计算机本身」——华为实际上是在把通信优势转化成计算优势。这是理解这场发布会的第二把钥匙。


六、SSD 开始从「硬盘」变成「内存」

一张很容易被忽略的 PPT:OceanStor M900 AI 记忆存储。它要存的东西是 KV Cache——Agent 每一轮的上下文状态,而非模型文件本身。

现场展示的是一套分层结构¹²。

图 7 HBM、DRAM、SSD 之下长出第四层:全局 KV Cache 池。SSD 从硬盘变成内存。来源:华为全联接大会 2026

为什么突然需要这么大的 KV Cache?因为 AI 的工作负载变了。以前的大模型是输入、推理、输出;Agent 是读上下文、思考、调工具、拿结果、再思考、存状态、下一轮继续。Agent 越多、上下文越长,系统就越不像一个计算器,越需要记忆。

同一个逻辑也解释了为什么华为把鲲鹏通算超节点一起升级:海量 Agent 并发与交互需要通用算力,TaiShan 950 SuperPoD 从 8 节点扩到 4,096 节点,单柜 16 颗 CPU 扩到 128 颗,内存池化从 24TB 到 256TB¹³。Agent 不只要 NPU 算,还要 CPU 跑工具、跑环境、跑状态。

大模型首先把算力变成稀缺资源,Agent 正在把记忆也变成稀缺资源。

于是 SSD 开始承担过去属于内存体系的职责,一个新的 AI 内存层级正在形成:HBM、DRAM、Memory SSD、KV Cache 池、存储。以后不能再把 SSD 简单看成「存储产业」,NAND、SSD 主控、存储软件、DPU、分布式存储,都会出现新需求。


七、一个 96kW 的机柜,就是一条新产业链

报道里有一个数字很容易被跳过:96kW。

Atlas 950 SuperPoD 单个 64 卡计算柜配 3 个电源框、18 个电源模块,每个约 6kW,形成约 96kW 级集中式供电;官方产品页描述为约 100kW。380V 交流进,54V 直流母线出,通过母线排 Busbar 送到每一片刀片。分液器Manifold 上 18 对盲插快接头加 4 对手插快接头;整柜 44OU,满配约 1,650–1,700 公斤⁶。

图 8 展区拆开给人看的 NPU 刀片与 CPU 刀片:铜色冷板、液冷管路、盲插接头,一片刀片就是半条液冷产业链。摄影:蒋涛
过去一个服务器机柜最重要的是 CPU、内存、硬盘、网卡。现在一个百千瓦级 AI 柜需要母线排、高功率电源、电压调节模块(VRM)、冷板、分液器、冷量分配单元(CDU)、快接头、冷却液、管路,以及整个数据中心的变压器、UPS、配电和冷却。

灵衢互联刀片已经配置全液冷,因为互联带宽上升以后,互联芯片本身成了除计算芯片之外的重要热源⁶。AI 系统的功耗已经不只是「GPU 很热」,Fabric 自己也是功耗大户。液冷因此从服务器附件,变成计算、互联、供电、管理协同的整柜级热管理。

把这场发布会的所有 PPT 放到一张图里,是一张中国版 AI Factory 产业图——英伟达说 AI Factory,华为今天给出的是同一个词的中国版本。

图 9 所有硬件都换算成每美元、每瓦多少 Token。来源:作者整理

华为今天同时讲芯片、HBM、光引擎、灵衢、交换机、KV Cache 和百万卡,看似不同产品线,其实是一台 Token 工厂的组成部分这条链的性能公式是乘法,不是加法——这是一个理解框架。任何一个环节成为瓶颈,整个系统都被它限制。一颗 GPU 性能提高 30%,HBM 喂不进去,没用;HBM 够快,一万颗芯片互相等通信,没用;芯片和网络都够快,KV Cache 不断从慢存储重读,Agent 还是慢;所有东西都解决了,100kW机柜没有足够电,还是跑不起来。


八、对面是谁:按峰值算力粗算,百万昇腾 960 约相当于十几万张 Rubin

两个 Token 指标一出来,就绕不开一个问题:对面是谁。

把华为的 10T 训练参考方案和英伟达 2027 年的 Rubin 代进同一道题:10 万张 960 卡 30 天训一个 10 万亿参数 MoE,按 FP16 取 FP8 一半算,MFU 要稳在四成以上;华为自己那条曲线给 4K 超节点的是 31%,两者对上的条件是训练主要跑在 FP8 上。同一件事换 Rubin 做,在假设双方 MFU 相同、按 FP16 取 FP8 一半的简化换算下,约 1.35 万张卡¹⁹。反过来说,百万张昇腾 960 约相当于十几万张 Rubin,单卡差 8 倍上下

并排看两台"计算机":960 超节点用 4,096 颗 NPU 做到 8 EFLOPS FP8;Rubin Ultra NVL576 用 144 个 GPU 封装、576 个计算 die 做到约 5 EFLOPS。按封装数算前者约 28 倍,按计算 die 数算约 7 倍。

英伟达"芯片强、补通信",华为"通信强、堆芯片",两条线在"一台计算机"上交汇。交汇的证据是两家都把整台机器的芯片攥在自己手里:英伟达 Vera Rubin 平台七颗芯片全部投产,华为围绕灵衢开发 11 颗关键芯片,算、联、存、管四类——AI Factory 是一组芯片,不是一颗。

还要纠正一个观点:电便宜救不了每美元 Token。按 Rubin 实测每度电约 2 亿 Token,电费在每百万 Token 成本里不到 5%²⁰。决定每美元的是整套系统的芯片与基础设施折旧、利用率和软件效率;华为用更多芯片换系统算力,国产 NPU 的成本和良率够不够低,比电价关键得多。电的价值在拿得到电——并网快是时间优势,不是成本优势。

单卡差距决定需要多少芯片;系统能力决定这些芯片有多少真正用于计算;产业链能力决定这样堆芯片在经济上能不能成立。这篇文章讲的是第三层。


九、资本在锁链条,中国需要自己的「需求侧产业政策」

这条链上还有一个更大的外部变量。

SK 海力士二季度财报披露,已与约十家关键客户签订多年期供应协议;美光的说法更直接:2026 年全部 HBM 产能已在多年期合同下售罄,只能满足客户一半到三分之二的需求,客户押金及财务承诺约 220 亿美元,其中现金约 180 亿⁸。全球超大规模云厂商的 AI 基础设施支出,2025 年实际 4,050 亿美元,2026 年预计 7,500 亿,单年近乎翻倍,2027 年 1.2 万亿;已公布的承诺投资总额 2 万亿。《金融时报》的口径更直白:2023 年以来,仅四家最大的科技公司就投了 1.1 万亿¹⁶。

图 10 4,050 亿 → 7,500 亿 → 1.2 万亿美元:资本先于产能,谁的订单先到,谁的供应链先扩产。来源:华为全联接 2026 引高盛、彭博、《金融时报》

这些钱买的远不止英伟达 GPU:HBM、先进封装、光纤与光互联、数据中心、电力设备,甚至电力本身,都在提前锁。

这产生了一个过去容易忽略的结果:全球 AI 硬件的竞争不只是技术竞争,也开始成为产能竞争。第三节说 HBM 产能被订走,放到整条链上就是这个结果:从 HBM 到光纤到发电机,被订走的是未来三年的新增产能。

美国巨头用数千亿美元 CAPEX 做的,本质上是需求侧融资:用未来订单告诉 HBM 厂、晶圆厂、封装厂、光通信厂和电力设备厂,你扩产,我买。

这也是为什么我认为,字节、阿里、腾讯、华为未来几年的 AI CAPEX 有一个被低估的意义。它们买的不只是算力。大量采购国产 NPU、HBM、光模块、交换机、SSD、液冷设备,等于在告诉整个国产供应链:你敢扩产,我就敢买。这样的订单已经出现:彭博 9 月报道,DeepSeek 计划在内蒙古部署至少 16 万颗昇腾 950DT,约 25.6 亿美元;而 950DT 今年产量受 HBM 等短缺限制在数十万颗,交付要一年以上——订单先到,产能后到。

美国正在用资本把技术优势固化成产能优势;中国需要用订单把技术突破放大成产业能力。于是中美 AI 硬件竞争越来越像一个飞轮:AI 公司下订单,供应商敢扩产,规模扩大,成本下降,技术迭代加快,AI 公司再下更大的订单。谁的飞轮先转起来,谁就先拿到下一代的产能。

十、从 Chip-centric 到 System-centric,三个动作

过去几年资本市场最容易理解的故事是:英伟达很贵,所以国产 GPU 替代。今天看,这个逻辑太窄了。真正值得重新评估的是整张产业地图。

 
环节
判断
最需要补
先进逻辑制程、HBM、先进封装、系统软件生态
技术与产能双重约束,谁先建立五年期需求信用谁先起来。软件层:CANN 已开源,950 上市即开源,40 余个模型原生预训练;但 5,270 名月活开发者说明生态仍在起步,这一层与 CUDA 的差距最大
有产业基础
光通信、交换机、服务器、SSD 与存储、电源、液冷
从「配件」升为 AI 计算机「主件」,价值随系统化上移
新价值最集中
HBM、封装、Fabric、光、SSD、液冷
原来被视为「不那么核心」的环节,正在决定有效算力

因为 AI 计算正在从 Chip-centric 变成 System-centric。

未来的竞争,不是人与人,而是时间与时间的竞争。硅基时间的产能在哪里被造出来,明年的竞争力就在哪里。

这场发布会对中美意味着两件不同的事。

对中国,它换了一个答案。三年前的问题只有一个:什么时候能做出一颗替代英伟达的芯片;今天的答案是,同代的那一颗短期做不出来,不等于只能等——竞争可以从单芯片拉到系统,把 HBM、封装、光、交换、存储、供电、液冷和软件重新组合,用另一种做法建起 Token 工厂。代价也清楚:更多芯片、更高功耗、更复杂的系统,最后都要过四个数的检验——每美元 Token、每瓦 Token、集群有效利用率、长期可用率。

对美国,出口管制能加大中国拿到最先进单芯片的难度,也在推着中国把资源投进一套自主的 AI 基础设施。中美 AI 硬件之争因此会从"谁的 GPU 更强",变成两座 AI Factory 的竞争:一座建在最先进芯片、HBM 和 CUDA 之上,另一座用更多国产芯片、通信、光和系统工程补单点差距。决定胜负的,是谁能用更低的成本、更少的电、更高的可靠性,持续生产更多 Token。

等明年 DeepSeek 十六万张 950DT 的推理账单出来²³,960 提前三个季度就只是个开头。
中美硬件线这场比赛,往后四年怎么看?把中国产业链的时间表摆出来,每年只看一件事、一个判断,尺子是对面的英伟达。
中美 AI 国运之争的硬件线,今天换了题:过去比一颗芯片,往后比一整条产业链。
计划后续再写一篇文章《华为的一百万卡,究竟相当于多少张英伟达?》——把 10 万亿参数大模型的 MoE、MFU、Rubin、功耗和每美元 Token 的账单独算一遍。
图片

“我们不介意你抄代码,但请别删名字!”谷歌被扒“抄袭”开源项目:228个文件一模一样,3个作者名却被抹去

iPhone Duo维修费8000元冲上热搜;赛力斯回应“问界撤出华为门店”;每小时成本超3万美元,罗福莉直播公开小米MiMo-V2.6训练 | 极客头条

蒋涛:大模型的“PC服务器时代”到来,解锁Token自由,走向人人程序员、行行炼模型

当 OpenAI、Anthropic、Google,到智谱、DeepSeek、Kimi、阿里都开始密集发布自进化相关研究,RSI 正从概念走向真正的技术竞赛。
11 月 20—21 日,2026 奇点智能技术大会「大模型技术:从 Agentic Scaling 到 RSI」专场,将邀请一线研究者与工程专家,围绕 Agentic Scaling、RSI、自进化闭环、持续学习、AI 制造 AI 等关键问题展开分享。

同时,我们整理了 《RSI(递归自我改进 / 自进化)前沿研究资料包》,汇总 OpenAI、Anthropic、Google、DeepSeek、智谱、Kimi、阿里等最新论文、官方技术报告与研究出处。

👇 扫描下方海报二维码,领取 RSI 前沿资料包,并了解专题参会详情。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →