阅读,与值得关注的内容Readance

联想黄山谈AI基建的精算时代:Token账单背后的企业转向|高端访谈

一个Token背后叠着九层成本结构,一次智能体任务连着几十步执行链路,降本不是换一块更便宜的GPU,而是从芯片到运营的系统工程


文|吴俊宇 

编辑|谢丽容


过去半年,企业对Token(词元)的态度正在逐渐变化。

两三年前,生成式AI(人工智能)刚进入企业时,Token价格低、用量也有限。一名员工一个月可能只消耗几百万Token。对企业来说,当时更重要的问题是先把AI用起来。2025年末至2026年初,硅谷和中国的一批科技公司一度鼓励员工尽可能多地使用Token。

2026年,智能体普及改写了这笔账。一项任务不再只是一次问答,它可能需要连续执行十几步、几十步,Token消耗随之快速增加。一名研发人员使用编程智能体,每天消耗的Token可能从1亿起步。

今年6月之后,越来越多的企业开始担心Token账单失控。曾经被用来鼓励员工多用AI的Token排行榜,在一些公司内部逐渐消失,取而代之的是按部门、按人头分配额度。

企业开始面对一个更现实的问题:花出去的Token到底产生了多少实际价值?

企业态度转变的背后,是一系列绕不开的追问:生产一个Token需要多少成本?不同能力的Token应该如何选择?有限的算力应该如何分配?一名员工消耗更多Token之后,能否带来更高的人均产出?Token创造的价值,最终能否覆盖它消耗的算力、资本和人力成本?

换句话说,“Token经济”开始从一个技术概念,变成一个现实的企业经营问题。

今年9月,我们与联想中国基础设施业务群战略技术总监黄山对谈——黄山今年8月刚与团队合著出版《词元工厂》一书,从成本视角拆解一个Token背后的硬件折旧、能源、运维、软件与人力。

这场对话要拆的,就是这笔账。

Token成本,怎么降下来?

谢丽容:2026年算力一直在涨价,Token成本究竟受到哪些因素影响?

黄山:以推理计算为例,优化和不优化的效率差距非常大。一个原本成本10块钱的Token生产任务,经过层层优化,有可能降到1块钱左右。

计算内部本身就有很多层优化空间。

先是芯模适配。同一块GPU(图形处理器)跑DeepSeek和智谱GLM,需要做的优化并不一样。把芯片和模型匹配好,一套新的芯模组合经过优化,性能可能提升30%-40%,对应的单位Token成本也会明显下降。

再往下,是计算系统怎么搭建。采用不同的GPU互联方式和系统形态,计算效率明显不同。比如,超节点和普通的服务器,效率可能会相差1.5倍甚至2倍。

硬件之上,还有整套推理软件栈,包括算子库、通信库、内存管理、推理框架以及并行策略等,这里面同样存在多层优化空间,叠加起来可能再带来两倍以上的效率差异。

这些优化并不是简单相加,而是乘法关系。所以,如果把成熟开源社区提供的能力作为基线,再经过专业计算厂商在芯模适配、计算系统和软件栈上的持续优化,理论上一个原本成本10块钱的Token生产任务,有机会降到1块钱左右。而这还只是计算层面的降本。

谢丽容:这就像把海绵里的水尽量挤出来。除了计算,还有哪些方式可以进一步降低Token成本?

黄山:计算只是其中一部分。如果把模型、运营、调度和IDC(数据中心)基础设施都算进去,整个Token成本优化体系大致可以拆成九层。

比如在运营层,白天业务繁忙、晚上算力闲置,就可以把一些不需要人工干预的任务调度到夜间执行,提高算力利用率。

模型路由也是一种方式。要根据任务复杂度自动选择更合适的模型。复杂问题可以调用能力更强的大模型,简单问题如果也一直用最好的模型,就会造成浪费。

再往上,还有智能体编排、算力调度、FinOps(财务运营)等。FinOps通俗地讲,就是根据资源价格和使用情况的变化,尽量在更合适的时间使用更便宜的资源。

再往IDC基础设施层看,还包括建设、选址、电力成本、液冷等。这些环节最终都会反映到单位Token成本上。

谢丽容:在这些影响Token成本的因素中,现阶段最大的变量是什么?

黄山:目前看,最大的变量还是计算效率。单是计算这一层,对Token成本的影响就可能占到三分之一以上,甚至接近一半。

联想现在已经有一些大型Token工厂的实践案例。在这类项目里,算力往往占到整体投入的一半以上。因此,计算效率会直接影响单位Token成本。现阶段,这一项因素对Token成本的影响,大约可以达到三分之一到二分之一。

谢丽容:所以降低Token成本,已经不是简单选择一块更便宜的GPU。它是要做好从芯片、模型、软件到运营的一整套系统工程?

黄山:是的。智算中心主要解决的是计算问题,但计算只是其中一个环节。Token工厂,是要把整个智能生产过程串起来。

它覆盖的是一整套流程——从前期的顶层规划,到数据就绪,再进入智算中心完成计算,产出模型或者模型服务。之后,这些能力还要进一步嵌入企业的工作流,与人协同完成实际业务。

谢丽容:Token工厂会是一套相对稳定的系统吗,还是需要持续迭代?

黄山:Token工厂必须具备自演进能力。它生产出来的模型或模型服务,不可能一开始就是完美的。进入真实业务环境以后,一定会暴露出新的问题。

用户在实际使用中产生的数据和反馈,要重新回到Token工厂,再进行加工和优化,形成新的模型服务、智能体或者工作流。

这就像一个持续运转的数据飞轮——数据进入工厂产生智能,智能进入业务接受检验,再把新的数据和问题反馈回来,继续迭代。

从更长期看,模型本身也还在继续演进。Scaling Law(缩放定律)仍然在发挥作用,数据集、模型规模扩大之后,对算力的需求也会继续上升。但算力供给未必能够同步增长,所以未来不仅要依赖更多算力,也会越来越依赖计算系统本身的优化效率。

把Token用对地方,要做什么?

谢丽容:企业真正决定推进AI改造之后,最直接的痛点是什么?

黄山:第一个痛点其实是迷茫。企业知道自己要做AI,但不知道应该先做什么。

很多客户并不清楚模型到底能解决哪些问题,也不知道在哪些业务场景里,AI相比现有工作方式能够真正提升效率。具体到研、产、供、销、服各个环节,哪些适合优先改造,哪些现阶段并不值得投入,很多企业还没有答案。

但企业的预算不可能同时铺到所有场景。所以真正需要做的,是先识别那些成功概率更高、业务价值更明确的场景,把有限的预算优先投进去,再通过实践逐步扩展。

谢丽容:不同企业的需求差异很大,并不是所有客户都需要最先进的模型和芯片。企业应该怎么判断,什么样的模型、算力和方案最适合自己?

黄山:这首先是顶层规划要解决的问题。顶层规划要贯穿Token工厂从建设到运营的整个过程。企业需要先想清楚,选择什么样的模型、算力和技术方案,以及这些能力最终应该落在哪些业务环节。

但如果进入一个并不熟悉的行业,仅靠技术方案还不够。这时候就需要FDE(前线部署工程师)和客户一起共创。FDE团队一方面要具备AI计算方案的设计能力,另一方面也要进入客户现场,深入理解这个行业原有的业务流程。

这个过程往往不会很短。最终的目标,不只是把模型部署进去,还要用AI重新设计一部分生产流程和工作流程。

谢丽容:这套模式听起来比较重,周期也很长,似乎更适合有一定数字化基础的大型企业。但现在很多AI应用反而是从个人开始,自下而上扩散到组织。对于中小企业或者长尾客户来说,这套模式会不会太重?

黄山:不同规模的企业,路径确实不一样。

对于大型集团企业来说,不能只依靠个人自发使用AI。企业既要激发员工自下而上的创新,也需要自上而下制定规则、做顶层规划。这两条路径要结合起来。越是业务复杂的大型企业,越需要建立一套相对完整的Token工厂,生产和管理自己的智能能力。

但对于中小企业或者个人来说,就不需要这么重。直接使用现成的AI工具和公有模型服务,往往就可以解决很多具体问题,没有必要一开始就搭建完整的顶层规划和基础设施。

谢丽容:今天AI技术的变化,也在影响企业内部的代际关系和创新方式。现在很流行“老登、中登、小登”这样的说法。这背后其实隐含一种判断:年轻人更容易成为AI原生用户,没有那么多旧流程和旧工具的包袱,有了AI之后,也更容易快速实现自己的想法。这是不是意味着,企业过去主要依赖自上而下推动变革的方式,也需要发生变化?

黄山:年轻一代使用AI的热情和上手能力确实更强。他们更接近AI原生,不太容易被过去的知识体系和工作方式束缚,往往也能更快做出新的应用。

但也不能什么都讲AI原生。今天大量业务并不是建立在AI基础上的。业务越复杂、价值链越长,就越难在短时间内被AI完全重构。

现在已经有一些场景能够比较明确地看到AI的价值,比如编程、事务性工作,包括HR、财务,金融风险分析、办公自动化,以及科研里的基因组计算、制药等。

但这并不意味着AI已经适用于所有行业、所有环节。现实中可能有成千上万个生产场景,今天真正成熟的,也许只是其中几十个、几百个。企业更现实的做法,是先把这些已经验证有效的场景做深,再逐步向更多环节扩展。

谢丽容:企业做AI转型时,经常先纠结是自建,还是采购外部模型和服务。这个决策应该怎么做?如果企业不自建,会不会失去对核心能力的掌控?

黄山:自建和公有云不应该是二选一,企业最终一定会走向混合部署。

企业真正核心的智能能力,还是要掌握在自己手里。比如,已经验证能够直接创造业务价值的模型、智能体,以及财务、研发、法务等涉及核心数据的场景。这些数据本身有隐私和安全要求,企业也要承担数据安全的第一责任,因此更适合在自己的Token工厂里处理和生产智能。

但这并不意味着所有能力都要自己建设。公有云最大的优势是规模和弹性,能够服务更多客户、提高算力利用率,因此很多通用能力可以更高效地通过公有云获得。

所以企业真正需要做的是划清边界:哪些属于自己的核心数据和核心智能,需要留在内部;哪些属于公共数据和通用能力,可以尽量利用公有云。最终找到适合自己的混合部署方式。

企业用Token,怎么算清这笔账?


谢丽容:这半年,很多企业开始从鼓励员工大量使用Token,转向控制Token成本。为什么会有这个变化?

黄山:进入Agentic AI(代理式AI)阶段以后,AI不再只是回答一个问题。它会连续执行十几步、几十步任务。

过去用DeepSeek-R1这类模型做问答,一个人一个月可能只消耗几百万Token,而且Token价格很低。企业不会特别在意投入产出,更重要的是先让员工用起来。

但现在不一样。随着研发团队开始大规模使用编程智能体,一个员工一天就可能消耗1亿Token。到了这个量级,Token开始成为一笔显性的成本。企业管理者就会开始追问:要不要继续推广?这笔账应该怎么算?投入之后到底能带来多少回报?

所以现在很多企业面对的问题,已经不是要不要用AI。他们思考的是,怎么在继续扩大AI使用的同时,把Token的经济账算清楚。甚至连Meta这类美国科技公司也是如此。

谢丽容:企业现在越来越关心Token成本。有人把它计入人力成本,有人放在业务费用里,也有很多企业还没有想清楚。企业应该怎么做Token的精细化运营?

黄山:现在还不敢说已经形成了一套成熟的精细化运营方法,但比较现实的做法,是以业务场景为闭环来管理。

企业可以先识别出一个具体的业务场景,再由这个场景的负责人对投入产出负责。比如,在现有人员和支出基本不变的情况下,引入AI之后能够多完成多少任务?这些新增任务能够创造多少价值?为了支撑这些任务,又需要投入多少模型、算力和Token成本?把成本和价值放在一起,才能算清楚这笔账。

对于大型企业集团,也可以沿着业务逐层拆解:从集团业务拆到不同业务板块,再拆到不同职能,最后落到个人可以贡献的具体工作。因此,Token管理需要Top-down(自上而下)和Bottom-up(自下而上)结合。

Bottom-up能够告诉管理者,一线员工现在已经在用AI做什么,哪些能力真正从业务实践中长出来;Top-down则要回答,这些能力放到整个业务里,到底能创造多少价值。两者结合起来,企业才能判断Token应该投在哪里、投多少。

谢丽容:能不能以一个具体的场景来算清这笔账?

黄山:企业里有很多工作是必须做的,但并不意味着每一项工作都值得用AI改造。

比如,软件研发过程中,每次发布版本前都要整理测试数据、架构数据,并形成发版报告。过去,这项工作由一名资深工程师完成,大概要花5天。如果先对相关数据进行治理,让模型能够识别这些数据,再用AI辅助工程师完成报告,时间可以缩短到3个小时。

表面看,效率提升非常明显。但这类需求一个季度可能只发生一次,一年下来大约节省20人天。如果为了实现这项能力,需要投入更高的数据治理成本,那这笔账可能并不划算。

反观另一个场景。给编程团队购买模型和AI Coding(AI编程)工具,每人每月大约200美元,整个团队一个月可能要花几千美元。但如果它能把一次计算优化的周期从一个月缩短到两周,团队就能服务更多客户,生产效率接近翻倍。这个场景的投入和回报就比较清楚。

所以企业真正要做的,是一笔一笔把账算明白:这个场景能带来多大回报,为了获得这部分回报,又需要付出多少数据治理、模型、算力和人力成本。算清之后,再优先投入价值更高的场景。

谢丽容:企业投入AI基础设施之后,最关心的问题之一就是多久能回本。决定回本速度的关键因素有哪些?

黄山:主要有四个方面。第一,选对模型。企业要先识别真正高价值的业务场景,再根据这些场景选择最适合的模型。模型选得对不对,会直接影响后续效率和回本速度。

第二,做好芯模适配。这不是简单选一块GPU、再选一个模型,而是要把芯片和模型放进一整套计算系统里做系统设计,让这个组合尽可能高效地运行。不同GPU和模型的组合,效率差异可能很大。

第三,做好运营。计算系统搭建完成以后,还要解决模型路由、网关、智能体编排、TokenHub(Token管理中心)、FinOps以及算力调度等问题。企业不可能只使用一个模型,算力也不可能始终处于满负荷状态,所以运营效率同样会影响成本和回报。

第四,要为系统持续迭代预留空间。现在AI技术变化很快,今天选好的模型、芯片、计算系统和运营体系,一年之内就可能需要再次调整。企业不能只算第一次建设的账,还要把后续系统改造和迭代的成本考虑进去。

所以最终决定回本速度的,不是某一个单点。要关注能不能选对模型、做好芯模适配和运营,并持续迭代整个系统。

未来三年,AI基础设施会怎么变?

谢丽容:展望未来三年,AI基础设施领域的最大变量是什么?

黄山:超节点。未来在大模型训练和大规模推理场景中,超节点会逐渐成为一种新的主流算力基础设施形态。场景规模越大,对集群效率的要求越高,超节点的价值也会越明显。

但这并不意味着所有企业都需要超节点。对于规模没有那么大的私有化应用,普通的AI服务器仍然可以满足需求。如果企业没有足够大的业务场景,也没有相应的投入产出,就没有必要为了追逐新技术去建设超节点。因为超节点本身的设计和建设门槛都非常高。

超节点本身还处在快速演进期。现在这一代产品还在继续完善,行业明年还会推出新一代设计,而且也不会是终极形态。我判断,未来至少三年,超节点都会持续迭代。

谢丽容:这会对算力市场的竞争格局产生什么影响?

黄山:超节点不仅是一种新的技术形态,也会形成一个新的竞争市场。它对厂商的研发能力、系统设计能力和资金能力都会提出更高要求。

它并不是简单从原有算力市场里切走一块蛋糕,而是在创造新的增量市场。现在超节点的市场规模还不算大,但增长很快。我们目前能够看到的国内市场规模,今年已经超过10亿美元。如果未来大规模推理也开始更多采用超节点,这个市场还会继续增长,甚至是每年翻倍增长。

背后的根本动力还是模型持续演进。Scaling Law(缩放定律)仍然在发挥作用,随着模型规模扩大,训练和推理需要的计算量也会继续增长。

谢丽容:面对确定性和不确定性并存的技术变化,联想做前瞻布局时,会看多长的周期?

黄山:联想通常会同时看一年、三年和五年。一年期,看的是已经比较确定、正在进入产业化阶段的方向。比如超节点,就是未来一年比较明确的重点。

三年期,会关注一些今天还没有形成规模、但可能发生结构性变化的技术路线。比如推理专用芯片,目前有TPU(张量处理单元)、NPU(神经网络处理器)、LPU(语言处理单元)等不同路线。它们各有优势,未来也未必一定会走向统一。

随着AI应用不断细分,芯片也可能从什么都能做的通用形态,进一步走向针对特定场景的专用形态。自动驾驶芯片已经是一个比较明确的例子,未来在科研以及其他应用领域,也可能出现更多专用芯片。

至于五年甚至更长期的方向,不确定性就更大了。联想更多是通过投资、预研和持续跟踪,保持对这些技术路线的理解,而不是现在就给出一个确定答案。AI变化太快,我甚至不认为今天有人能够真正看清三年以后的应用和市场会演变成什么样。

谢丽容:这一轮AI算力周期,把联想重新推到了聚光灯下。有人会说,这是老牌公司又赶上了一轮新的技术周期。您怎么看?

黄山:我觉得背后还是两种长期积累下来的能力。第一是供应链能力,联想有长期积累的全球供应链体系。

第二是系统集成和系统优化能力。今天做AI基础设施,已经不是有几块GPU就够了。模型越来越大,算力越来越走向集群化,软硬件之间的协同也越来越复杂。能不能把芯片、服务器、网络和软件整合到一起,并把整个系统优化好,这种能力正在变得越来越值钱。

谢丽容:所以这并不完全是赶上了风口,更像是过去积累的能力,在这一轮AI周期里重新被放大了?

黄山:是的。能够穿越技术周期的公司,往往要有处理复杂系统的能力。

一方面,要有足够的技术广度,能够把不同技术整合到一起;另一方面,也要有处理复杂业务的能力。这些能力都需要长期积累。同时,公司本身也要真正拥抱新的技术。如果还是沿用过去的方式,也很难把供应链、系统集成和AI真正结合起来。

联想过去最突出的标签是PC(个人电脑),基础设施业务没那么受关注。这一轮AI周期到来以后,基础设施重新成为一个重要市场,联想过去积累的供应链、系统集成和复杂系统能力,也有了新的价值。

尾声

聊到最后,答案并不复杂。

Token的成本,不是一块GPU决定的,而是从芯片、模型到运营的九层系统工程——十块钱能压到一块钱,靠的是把每层效率挤到极致。Token该花在哪?不追最先进的模型,只做最值得的场景:让业务负责人对投入产出负责,核心智能握在手里,通用能力交给云。账单怎么管?不按人头卡额度,按产出定投入——选对模型、做好适配、持续迭代,回本只是时间问题。

未来三年,超节点会重写算力基建的牌桌,芯片从通用走向专用。黄山最想强调的是:能穿越AI周期的,不是押中风口的人,而是把供应链与系统集成磨成长期壁垒的公司。

Token这笔账,算到最后,算的不是技术,是经营。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →