一颗芯片追不上英伟达,中国开始用 HBM、封装、光互联、存储和百万卡系统,换一种打法
硅基时间产业洞察 · 2026-09-17
华为轮值董事长汪涛在华为全联接大会讲完昇腾 960 提前就绪,接下来十几张 PPT 没有一张是芯片:光引擎、统一总线、100T 交换机、4,096 卡超节点、百万 NPU 集群、KV Cache 存储、96kW 液冷机柜。华为不是在发布一颗芯片,它是在把 AI 计算机从头到尾重新做一遍——竞争的基本单位从芯片换成了系统,中国的产业地图也从「国产 GPU 替代」扩成了一整条新链条。
一、路线图之后,还有十张 PPT
9 月 17 日,上海,华为全联接大会。展馆人满为患,主会场外排着长队,展区里国际参观者的密度比往届高得多。这个细节本身就是信号:来的人想知道,华为的芯片怎么追上英伟达,接下来打算怎么办。
先看路线图。960DT,2027 年一季度,比原计划提前三个季度;960PR,2027 年三季度,提前一个季度;970,2028;980,2029。此后一年一代¹。汪涛同时披露:昇腾超节点已部署超过 1,000 套(以 910C 为主),950 超节点已规模商用²。
华为接着发的是 Hi-ONE 光引擎、灵衢 UnifiedBus、100T UBG 交换机、4,096 卡的 Atlas 960E 超节点、100 万 NPU 的 Agentic 超节点集群、OceanStor M900 记忆存储、鲲鹏 950 通算超节点,以及一个 96kW 的液冷机柜³。
一颗芯片的发布会,不需要讲交换机和冷却液。华为讲了,因为它要交付的东西变了。汪涛的原话是:华为 AI 战略的核心是算力,"坚持硬件变现"¹⁸。
AI 竞争的基本单位,正在从一颗芯片变成一台计算机。
这句话是理解今天这场发布会、也是理解未来三年中国 AI 硬件产业的一把钥匙。
先把三个词说清楚:芯片,一颗 NPU;计算机,华为叫超节点,几千颗 NPU 连成逻辑上的一台,程序看到的就是一台机器;工厂,几百台超节点连成集群,再加上给它供电、散热、喂内存的整条产业链,产品是 Token——英伟达叫它 AI Factory。这篇文章的顺序,就是从芯片讲到计算机,再从计算机讲到工厂。
二、一颗芯片追不上,就重新定义「一台计算机」
中国 AI 芯片的基本现实没有变:把先进制程、HBM、封装、软件生态全部算进去,单颗芯片与英伟达最先进产品仍有差距。
华为选的路线是:既然一颗芯片短期追不上,就不只比一颗芯片。
现场最让我印象深刻的一张图是 Atlas 960E SuperPoD(官方通稿称「昇腾 960 超节点」):4,096 NPU 统一内存编址,全域 D2D RTT 2 微秒(华为 PPT 原始口径),2027 年三季度上市⁴。去年全联接把 Atlas 960 SuperPoD 说成最多 15,488 卡、30 EFLOPS,今年收成 4,096 卡、8 EFLOPS(FLOPS 是每秒浮点运算次数,芯片算力的峰值口径;1 PFLOPS 是每秒一千万亿次,1 EFLOPS 是它的一千倍;)
这不是简单缩水,而是产品边界重划:Scale-up 的“单台逻辑计算机”收敛到 4K NPU,更大的规模交给 Scale-out。这已经不是「4,096 台服务器联网」,它要做的是把几千颗 NPU 在逻辑上变成一台计算机:单超节点 8 EFLOPS FP8,HBM 容量 1PB。
这个方向在 950 上已经落地⁵。单柜把 64 颗昇腾 950DT、16 颗鲲鹏 950、互联、IO、供电和散热紧耦合在一起,CPU 和 NPU 按 2:8 组成逻辑计算节点。报道特别指出,这个设计的目的是让 CPU、NPU 和互联在逻辑上作为一个整体执行训练和推理,而不只是往柜子里多塞芯片⁶。
三、先进制程之外,中国最缺的可能是 HBM
再看路线图上的另一组数字⁷。
真正困难的地方可能在 FLOPS 之外:这么大的容量和带宽从哪里来。答案绕不开 HBM。
过去谈国产 AI 芯片,注意力都在 7 纳米、5 纳米、3 纳米落后多少。但 AI 芯片已经变成三件东西的组合:Compute Die、HBM、先进封装。缺任何一块,另外两块都发挥不出来。
以前的限制是「不能卖给你」,现在多了一层:「等你想买时,产能已经被别人订走了」。
后一层比前一层更难对付:技术突破解决不了它,它要的是产能、资本和长期订单。
这决定了国产供应链补课的先后,也是大买家下单、投资人下注该盯的顺序。NAND 可以买,DRAM 厂不必自建,HBM 不能等:设计、接口、封装、可控供应,缺一样,国产 GPU/NPU 做得再快也卡在内存墙上。它是最先要拿下的一环;接口、良率、产能爬坡哪一样掉队,先后才需要重排。
四、芯片里面靠封装,芯片外面靠光
先进制程短期不能同代竞争,还有没有别的办法?有。华为这场发布会给了两个答案:芯片里面靠先进封装,芯片外面靠高速互联。
封装过去被当作半导体的「后道」。AI 改变了这件事。当 Compute Die、HBM、I/O Die 越贴越近,封装开始决定带宽、延迟、功耗、散热和良率。它从「把芯片装起来」变成了延续摩尔定律的一种方式。以后衡量一颗 AI 芯片,不能只问几纳米,还要问:几个 Compute Die,多少 HBM,多大内存带宽,什么封装,Die-to-Die 带宽多少。芯片本身已经是一个小系统。
芯片外面,是光。现场另一张 PPT 的价值不低于 960:Hi-ONE NPO 光引擎,华为称这是业界首个量产、也是传输能力最大的近封装光引擎⁹。落到 960 超节点上:5,500 个 Hi-ONE 替代原本需要的 48,000 颗 800G 光模块,功耗降低 550 千瓦以上,系统可用度 99.8%¹⁸。
华为要解决的问题很朴素:几千、几万颗芯片连在一起以后,纯电互联开始碰到功耗、距离和信号完整性的边界。距离越远、速率越高,铜越吃力,光就不断向芯片靠近——过去是机柜之间走光,后来是板卡之间走光,NPO/CPO 时代是芯片之间走光。华为把这条原则叫「近铜远光」。
这件事对中国尤其重要。中国在全球 AI 产业链里最弱的是先进逻辑制程,过去二十年积累最深的能力之一恰恰是通信:光器件、光模块、交换机、光纤,产业基础完整。
过去二十年为互联网修路的中国通信产业,正在搬进 AI 计算机的内部。
光模块过去是「网络设备」,未来越来越像 AI 计算机的总线。AI 硬件的价值,正在从 GPU 向光扩散。
五、交换机也不再只是交换机
下一张更激进:灵衢 UnifiedBus 加两层 CLOS 组网,打造 100 万卡集群。单平面 32k,多平面到 1,024k;面向超节点集群的 100T 级 UBG 交换机,1,024 大 Radix,华为规划 2027 年四季度(现场 PPT)¹⁰。
华为做了两层架构。第一层 Scale-up:4,096 颗 NPU 组成一个超节点,追求极低延迟、极高带宽和统一内存寻址,让它们尽可能像一台机器。第二层 Scale-out:把大量超节点用 CLOS 网络连起来——两层 CLOS 四平面到 51.2 万卡,再加多轨道拓扑到 100 万卡¹¹ ¹⁸。
这时候交换机是什么?过去,交换机就是网络;现在,交换机是计算机的一部分。
这些数字为什么重要?如果几万颗 NPU 大量时间都在等通信,理论 FLOPS 再高也没有意义。Fabric 的效率直接决定理论算力能变成多少有效算力。放回硅基时间的公式,Fabric 就是并行系数的物理上限。利用率下降多少会损失多少有效算力,取决于模型结构、并行策略和 batch 等具体条件;但规模越大,通信等待对硅基时间产出的影响就越不能忽略。
这恰好是华为最值得观察的地方。先进制程是它的约束,通信却是它几十年的长板。当 AI 从单芯片走向万卡、百万卡,通信第一次从「计算机外面的网络」进入「计算机本身」——华为实际上是在把通信优势转化成计算优势。这是理解这场发布会的第二把钥匙。
六、SSD 开始从「硬盘」变成「内存」
一张很容易被忽略的 PPT:OceanStor M900 AI 记忆存储。它要存的东西是 KV Cache——Agent 每一轮的上下文状态,而非模型文件本身。
现场展示的是一套分层结构¹²。
为什么突然需要这么大的 KV Cache?因为 AI 的工作负载变了。以前的大模型是输入、推理、输出;Agent 是读上下文、思考、调工具、拿结果、再思考、存状态、下一轮继续。Agent 越多、上下文越长,系统就越不像一个计算器,越需要记忆。
同一个逻辑也解释了为什么华为把鲲鹏通算超节点一起升级:海量 Agent 并发与交互需要通用算力,TaiShan 950 SuperPoD 从 8 节点扩到 4,096 节点,单柜 16 颗 CPU 扩到 128 颗,内存池化从 24TB 到 256TB¹³。Agent 不只要 NPU 算,还要 CPU 跑工具、跑环境、跑状态。
大模型首先把算力变成稀缺资源,Agent 正在把记忆也变成稀缺资源。
于是 SSD 开始承担过去属于内存体系的职责,一个新的 AI 内存层级正在形成:HBM、DRAM、Memory SSD、KV Cache 池、存储。以后不能再把 SSD 简单看成「存储产业」,NAND、SSD 主控、存储软件、DPU、分布式存储,都会出现新需求。
七、一个 96kW 的机柜,就是一条新产业链
报道里有一个数字很容易被跳过:96kW。
Atlas 950 SuperPoD 单个 64 卡计算柜配 3 个电源框、18 个电源模块,每个约 6kW,形成约 96kW 级集中式供电;官方产品页描述为约 100kW。380V 交流进,54V 直流母线出,通过母线排 Busbar 送到每一片刀片。分液器Manifold 上 18 对盲插快接头加 4 对手插快接头;整柜 44OU,满配约 1,650–1,700 公斤⁶。
灵衢互联刀片已经配置全液冷,因为互联带宽上升以后,互联芯片本身成了除计算芯片之外的重要热源⁶。AI 系统的功耗已经不只是「GPU 很热」,Fabric 自己也是功耗大户。液冷因此从服务器附件,变成计算、互联、供电、管理协同的整柜级热管理。
把这场发布会的所有 PPT 放到一张图里,是一张中国版 AI Factory 产业图——英伟达说 AI Factory,华为今天给出的是同一个词的中国版本。
图 9 所有硬件都换算成每美元、每瓦多少 Token。来源:作者整理
华为今天同时讲芯片、HBM、光引擎、灵衢、交换机、KV Cache 和百万卡,看似不同产品线,其实是一台 Token 工厂的组成部分。这条链的性能公式是乘法,不是加法——这是一个理解框架。任何一个环节成为瓶颈,整个系统都被它限制。一颗 GPU 性能提高 30%,HBM 喂不进去,没用;HBM 够快,一万颗芯片互相等通信,没用;芯片和网络都够快,KV Cache 不断从慢存储重读,Agent 还是慢;所有东西都解决了,100kW机柜没有足够电,还是跑不起来。
八、对面是谁:按峰值算力粗算,百万昇腾 960 约相当于十几万张 Rubin
两个 Token 指标一出来,就绕不开一个问题:对面是谁。
并排看两台"计算机":960 超节点用 4,096 颗 NPU 做到 8 EFLOPS FP8;Rubin Ultra NVL576 用 144 个 GPU 封装、576 个计算 die 做到约 5 EFLOPS。按封装数算前者约 28 倍,按计算 die 数算约 7 倍。
英伟达"芯片强、补通信",华为"通信强、堆芯片",两条线在"一台计算机"上交汇。交汇的证据是两家都把整台机器的芯片攥在自己手里:英伟达 Vera Rubin 平台七颗芯片全部投产,华为围绕灵衢开发 11 颗关键芯片,算、联、存、管四类——AI Factory 是一组芯片,不是一颗。
还要纠正一个观点:电便宜救不了每美元 Token。按 Rubin 实测每度电约 2 亿 Token,电费在每百万 Token 成本里不到 5%²⁰。决定每美元的是整套系统的芯片与基础设施折旧、利用率和软件效率;华为用更多芯片换系统算力,国产 NPU 的成本和良率够不够低,比电价关键得多。电的价值在拿得到电——并网快是时间优势,不是成本优势。
单卡差距决定需要多少芯片;系统能力决定这些芯片有多少真正用于计算;产业链能力决定这样堆芯片在经济上能不能成立。这篇文章讲的是第三层。
九、资本在锁链条,中国需要自己的「需求侧产业政策」
这条链上还有一个更大的外部变量。
SK 海力士二季度财报披露,已与约十家关键客户签订多年期供应协议;美光的说法更直接:2026 年全部 HBM 产能已在多年期合同下售罄,只能满足客户一半到三分之二的需求,客户押金及财务承诺约 220 亿美元,其中现金约 180 亿⁸。全球超大规模云厂商的 AI 基础设施支出,2025 年实际 4,050 亿美元,2026 年预计 7,500 亿,单年近乎翻倍,2027 年 1.2 万亿;已公布的承诺投资总额 2 万亿。《金融时报》的口径更直白:2023 年以来,仅四家最大的科技公司就投了 1.1 万亿¹⁶。
这些钱买的远不止英伟达 GPU:HBM、先进封装、光纤与光互联、数据中心、电力设备,甚至电力本身,都在提前锁。
美国巨头用数千亿美元 CAPEX 做的,本质上是需求侧融资:用未来订单告诉 HBM 厂、晶圆厂、封装厂、光通信厂和电力设备厂,你扩产,我买。
这也是为什么我认为,字节、阿里、腾讯、华为未来几年的 AI CAPEX 有一个被低估的意义。它们买的不只是算力。大量采购国产 NPU、HBM、光模块、交换机、SSD、液冷设备,等于在告诉整个国产供应链:你敢扩产,我就敢买。这样的订单已经出现:彭博 9 月报道,DeepSeek 计划在内蒙古部署至少 16 万颗昇腾 950DT,约 25.6 亿美元;而 950DT 今年产量受 HBM 等短缺限制在数十万颗,交付要一年以上——订单先到,产能后到。
美国正在用资本把技术优势固化成产能优势;中国需要用订单把技术突破放大成产业能力。于是中美 AI 硬件竞争越来越像一个飞轮:AI 公司下订单,供应商敢扩产,规模扩大,成本下降,技术迭代加快,AI 公司再下更大的订单。谁的飞轮先转起来,谁就先拿到下一代的产能。
十、从 Chip-centric 到 System-centric,三个动作
过去几年资本市场最容易理解的故事是:英伟达很贵,所以国产 GPU 替代。今天看,这个逻辑太窄了。真正值得重新评估的是整张产业地图。
因为 AI 计算正在从 Chip-centric 变成 System-centric。
未来的竞争,不是人与人,而是时间与时间的竞争。硅基时间的产能在哪里被造出来,明年的竞争力就在哪里。
这场发布会对中美意味着两件不同的事。
对中国,它换了一个答案。三年前的问题只有一个:什么时候能做出一颗替代英伟达的芯片;今天的答案是,同代的那一颗短期做不出来,不等于只能等——竞争可以从单芯片拉到系统,把 HBM、封装、光、交换、存储、供电、液冷和软件重新组合,用另一种做法建起 Token 工厂。代价也清楚:更多芯片、更高功耗、更复杂的系统,最后都要过四个数的检验——每美元 Token、每瓦 Token、集群有效利用率、长期可用率。
对美国,出口管制能加大中国拿到最先进单芯片的难度,也在推着中国把资源投进一套自主的 AI 基础设施。中美 AI 硬件之争因此会从"谁的 GPU 更强",变成两座 AI Factory 的竞争:一座建在最先进芯片、HBM 和 CUDA 之上,另一座用更多国产芯片、通信、光和系统工程补单点差距。决定胜负的,是谁能用更低的成本、更少的电、更高的可靠性,持续生产更多 Token。
“我们不介意你抄代码,但请别删名字!”谷歌被扒“抄袭”开源项目:228个文件一模一样,3个作者名却被抹去
iPhone Duo维修费8000元冲上热搜;赛力斯回应“问界撤出华为门店”;每小时成本超3万美元,罗福莉直播公开小米MiMo-V2.6训练 | 极客头条
蒋涛:大模型的“PC服务器时代”到来,解锁Token自由,走向人人程序员、行行炼模型
同时,我们整理了 《RSI(递归自我改进 / 自进化)前沿研究资料包》,汇总 OpenAI、Anthropic、Google、DeepSeek、智谱、Kimi、阿里等最新论文、官方技术报告与研究出处。
👇 扫描下方海报二维码,领取 RSI 前沿资料包,并了解专题参会详情。