一次两小时的编程会话,花掉1200美元。
这不是某个愣头青工程师手滑点错了套餐,这是Uber工程团队在使用Anthropic的Claude Code时留下的真实账单记录。
更离谱的是,这样的账单不是孤例。公司内部曾经维护一份排行榜,按Token消耗量给工程师排名,鼓励大家"多用AI"。
结果就是,原本规划要花一整年的AI预算,四个月就见底了。
Uber的故事在过去半年被反复讲述,不是因为它多么戏剧性,而是因为它精准戳中了整个行业正在集体经历的焦虑:当AI从聊天工具变成能自主写代码、跑流程的Agent,按Token计费的闭源大模型,正在把一种全新的财务风险,直接甩到CFO的桌子上。
这篇文章想讲清楚一件事:Uber这场"预算爆表"事故,不是意外,而是一次行业级别的信号弹。
本质上,它照亮了闭源API商业模式里一个长期被忽视的裂缝,也顺势把开放权重模型,那些参数可以下载、可以自己部署、价格低到近乎碾压闭源模型的模型,从技术圈的边缘话题,推到了企业决策层的案头。
这场转向能拆成三层来看:成本失控是引信,控制权焦虑是燃料,开放权重是那个正好赶上时机的替代方案。
三者叠在一起,构成了2026年这场看似突然、实则积累已久的行业转向。
成本:一张没有天花板的账单,是怎么烧出来的
时间拨回2025年12月。
Uber开始在工程团队内部推广Claude Code,这是Anthropic推出的Agentic编程工具,能自主完成从读代码、写代码到提交PR的整套流程。
听起来是效率神器,推广速度也确实惊人:2月份,32%的工程师开始用它;到3月,这个数字冲到了84%,几乎是团队全员标配。
到了春天,Uber内部统计显示,95%的工程师每月都在使用AI工具,大约70%的已提交代码由AI工具生成,甚至有11%的后端线上更新,是AI Agent在无人介入的情况下独立完成的。
这套数据放在任何一份"AI提效"的PPT里都能当范本。但硬币的另一面是账单:工程师平均每月花费150到250美元,重度用户的月账单能冲到500到2000美元。那个著名的"两小时1200美元"编程会话,就发生在这个阶段。
到2026年4月,Uber宣布:全年AI预算,四个月花完了。紧接着的动作很直接:公司把每位工程师每个工具的支出上限压到1500美元,COO在公开场合直接质疑这笔钱到底值不值。
几周后,特斯拉也做出了类似决定,把工程师使用外部AI工具的开支硬性限制在每周200美元,此前有些工程师单周消耗就已经是"几千美元"的量级。
这两起事件放在一起看,意味就变了。这不是"Uber一家公司管理不善",而是整个行业在同一套商业模式下,几乎同时撞上了同一堵墙。
Uber CTO Praveen Neppalli Naga后来说了一句令人深思的话:“我们正在迎来所谓’tokenmaxxing时代’的终结。下一个阶段的核心,不是谁花的Token最多,而是怎样尽可能高效地使用它们。”
扩展阅读:Token 账单正在失控!从 token maxxing 到 ROI 回归,企业 AI 的价值逻辑彻底变了
这句话背后藏着一个残酷的事实:闭源大模型的按Token计费模式,和Agentic AI的工作方式,天生是互相"放大"的关系。
传统的AI应用,是人问一句、模型答一句,用量相对可控。但Agent不一样,它会自己拆解任务、自己调用工具、自己迭代重试,一个看似简单的需求,背后可能触发几十次模型调用。
当你把这套东西铺给几千个工程师,而计费方式又是"用多少算多少",财务模型很容易就跟不上实际消耗速度,这恰恰是Uber踩中的那个坑。
行业里有个数据侧面印证了这种系统性风险:只有43%的企业为AI工具建立了正式的治理策略,而具备成熟Agentic治理能力的企业,只有21%。
换句话说,大多数公司还在用管理"员工订阅Office"的思路去管理AI支出,却没有像管理云计算账单那样,给AI用量装上实时监控、单人限额和超支预警。
Uber把Claude Code铺给全公司时,恰恰缺了这套刹车系统,后果在一个财季内就显现出来。
Gartner的预测给这场焦虑加了一层更冷的注脚:到2030年,Token的单价可能下降90%,但企业的AI总支出未必会跟着降,因为Agentic工作流消耗的Token总量增长速度,很可能远远跑赢单价下降的速度。
降价的红利,不会全部落到用户账户上。这是很多决策者容易忽略的一点:大家总在盯着"每百万Token多少钱"这个数字下降,却没意识到分母,也就是Token消耗总量,正在以更快的速度膨胀。省下来的钱,压根没机会落到账上。
这就是问题的核心:企业开始意识到,自己在跟一台没有仪表盘的计价器较劲。而应对这种失控感,最直接的办法之一,就是换一种完全不同的成本结构,把模型这个"黑箱"变成自己手里能看、能改、能部署的东西。
替代:开放权重的逆袭,便宜到让闭源模型难受
开放权重模型(open-weight model)指的是那些参数可以公开下载、任何人都能在自己服务器上部署和微调的模型,和"调用API、按量付费"的闭源模式形成了鲜明对照。
价格差距有多大?阿里的Qwen-Turbo,每百万输入Token的价格大约五分钱;智谱的GLM 5.2,在编程基准测试上能和头部闭源模型正面掰手腕,价格却只有对方的五分之一左右。这不是"便宜一点",这是"便宜一个数量级"。
更能说明趋势的是采用曲线。大型企业里,开源/开放模型的采用率在两年内从23%涨到67%,相关企业报告的成本节省幅度普遍在70%到90%之间。
给企业提供开放权重模型推理服务的Together AI,处理的Token量从每月300亿飙升到400万亿以上,涨了差不多一万倍,公司也顺势拿下8亿美元C轮融资,估值冲到83亿美元。CEO Vipul Ved Prakash的说法很直白:“过去一年,开放权重模型经历了近乎踩踏式的涌入,它们已经真正成为Agentic AI的主力。”
真正让这场转向变得不可逆的一步,来自一个意想不到的角色:OpenAI自己。
2025年8月,这家从GPT-2之后就彻底走向闭源、靠API构筑商业帝国的公司,发布了gpt-oss-120b和gpt-oss-20b,用的还是最宽松的Apache 2.0许可证,单张80GB显卡就能跑,性能贴近自家的o4-mini。Dell在发布当天就把企业级部署方案摆上了货架。
一家守了六年闭源路线的公司主动松手,这本身就是一次姿态宣言:开放权重浪潮,已经不是能靠一家公司的战略选择去挡住的东西了。某种程度上,这也是OpenAI在给自己上保险,如果不主动放出一部分开放权重能力,这块市场也会被别人占走,还不如自己先占位。
这波浪潮里最让人意外的主角,是来自中国的模型。中国开源模型在OpenRouter平台的Token占比,从2025年上半年不到5%,一路涨到过去几个月的30%到46%,阿里的Qwen系列累计下载量突破10亿次,超过Meta的Llama,成了全球下载量最大的开放模型家族。
谷歌的Gemma下载量也过了4亿,英伟达的Nemotron从春天的5000万飙升到7月初的1亿,并联手法国Mistral组建了新的开放模型联盟。微软的Phi系列也在用更小的体量,在不少任务上追平前沿模型的表现。
对美国企业来说,这些开放模型能提供"够用、够便宜、还能自己部署"的三重满足,这恰好是Uber式预算危机最想要的解药。
但这里有个容易被忽略的陷阱:开放权重不等于零成本。自己部署意味着要买GPU、要养运维团队、要处理安全补丁,这笔隐性的总拥有成本(TCO),经常被"每百万Token几分钱"的表面数字给盖住了。
真正精明的企业,算的从来不是单价,而是把采购、运维、安全全部摊进去之后的综合账。
控制:表面是省钱,里子是话语权的重新谈判
如果这场转向只是单纯的价格竞争,故事讲到这里就该结束了。但真正让企业决策层坐直身子的,是另一层更深的焦虑:数据主权和供应商锁定。
用闭源API,意味着你的业务数据要经过别人的服务器,推理逻辑藏在别人的黑箱里,定价权也完全握在对方手里。今天API提供商可以随时调价、限流,甚至因为政策变化直接切断服务,这种"被动"感,是很多CTO心里的隐痛。
更麻烦的是迁移成本:一旦整套业务流程围绕某家闭源API的接口和特性搭建起来,想换供应商就不再是"改个配置"那么简单,而是要重新验证、重新调优,这种被锁死的感觉,才是比账单数字更让人不安的部分。
开放权重模型给出的答案是:把模型搬回家。路透旗下的Thomson Reuters基于开放权重构建了内部模型Thomson-1,直接跳出闭源API的定价体系,把推理能力变成自己可控的基础设施。
这类案例正在变多,逻辑也很简单,当模型权重在自己手里,你至少能保证:不会因为某家供应商一次涨价决策,让整条业务流程被卡住喉咽。
这种焦虑甚至催生了一次罕见的产业联合。2026年7月,英伟达联合36家创始成员组建了"开放安全AI联盟"(OSAA),一周之内成员数扩张到120家以上,Adobe、微软、思科、IBM、Salesforce悉数在列。
这份名单的潜台词很清楚:开放权重模型不再只是"省钱工具",而是被定性为企业级的防御性资产,一种对抗单一供应商风险的战略储备。
有意思的是,Anthropic、Google和OpenAI最初都没有加入这个联盟,这种"缺席"本身也是一种立场表达。
亚马逊CTO Werner Vogels对这个趋势的描述很到位:我们看到企业正在从价格昂贵的大模型向更便宜的开源模型转移。
他补充说,企业对失控AI账单的恐惧,正在迫使他们重新思考"最强的模型该部署在哪里"这个问题,答案未必是"最贵的那个",而是"我能控制的那个"。
平衡:开放不是万能药,混合才是答案
把这场转向讲得太顺,反而不真实。行业里的分歧其实一直存在。
一部分人对开放权重模型的安全性和合规性仍持保留态度,权重开放意味着你要自己承担模型微调、安全对齐和漏洞修补的责任,这对没有足够AI工程能力的中小企业来说未必轻松。
也有人担心中国开源模型崛起背后的地缘政治敏感性,虽然大多数模型采用MIT或Apache许可证,支持完全本地化部署,理论上数据不出企业内网,但这种信任建立起来还需要时间。
LLM.co的CMO Samuel Edwards给出了一个更中性的判断:未来不是开源对阵闭源,而是两者的战略性协同使用。
这或许才是当下最靠近真相的说法。
多数企业并不需要把所有工作流都搬到开放模型上,更务实的做法是,按任务敏感度和成本敏感度,把不同模型分配到不同场景。
RouteLLM这类路由工具的出现就是这个思路的落地,它能把成本压到原来的三分之一左右,同时保留95%的输出质量。
Uber自己后来的应对方式,恰恰验证了这种"平衡论"。到2026年8月,靠着提示缓存优化和开放权重模型的试验性引入,Uber的每千次请求成本比4月高峰下降了近34%,每次会话成本比6月的高点下降了52%。
而AI Agent此时已经承担了公司超过70%的代码变更提交量,用量没有减少,反而在增长,只是花钱的方式变聪明了。
这恰好呼应了CTO那句"tokenmaxxing时代终结"的判断:问题不在于要不要用AI,而在于怎么用得起。
这场成本觉醒背后,还牵出了一个更根本的问题:企业到底该如何"管理"AI这个新员工。有调研显示,超过三分之一的英国员工认为,如果自己的上级是AI,反而能提高工作效率,但接近四成的管理者却不相信AI能带来任何实质性的生产力提升。
这种上下认知的错位,某种程度上和企业在AI预算问题上的手忙脚乱如出一辙:大家都在用AI,但很少有人真正搭建起匹配这种新工作方式的管理和财务框架。
Uber的教训说明,推广一项技术的速度,永远不该超过治理它的能力。
结论:如果你是那个要签字的人,该做什么
回头看整件事的时间线会发现一个规律:每一次"账单事故",都在往开放权重的方向推一把。
Uber四个月烧完预算,让全行业第一次直观感受到Agentic AI时代闭源计费模式的杠杆效应有多可怕;特斯拉紧随其后的封顶操作,证明这不是个案而是普遍焦虑;OpenAI自己放出开放权重模型,给这场浪潮盖上了官方认证的印章;英伟达联合上百家企业组建联盟,则把"开放"从技术选项升格成了产业级的风险对冲策略。
这一整条链路指向一个不算意外但值得说清楚的结论:企业加速转向开放权重AI,表面上是在省钱,骨子里是在争夺一件更重要的东西,控制权。
控制成本的天花板,控制数据的流向,控制自己不被单一供应商的定价决策绑架。
但知道这个结论没用,真正有用的是接下来怎么做。如果你正在为公司的AI战略拿主意,不妨先做这四件事。
第一,在铺开任何Agentic工具之前,先做一次用量沙盘推演,不是估算"用了能提效多少",而是估算"如果全员每天都用会花多少"。
Uber的教训不是"AI太贵",而是"没人算清楚Agent会把成本放大多少倍",这个测算,应该在推广前完成,而不是推广后补救。
第二,给AI支出装上和云计算账单一样的实时监控和硬性上限,单人额度、部门额度、超支预警,一个都不能少。特斯拉的每周200美元封顶看起来简单粗暴,但它确实是当下最有效的止血办法。
第三,别追求"全部开放"或"全部闭源"的二元答案,按任务分层。高敏感、需要顶尖能力的场景留给闭源模型,大批量、重复性、成本敏感的场景切给开放权重模型,用RouteLLM这类路由工具做自动分发,这才是接下来两年最主流的架构,而不是某一方彻底取代另一方。
第四,如果决定自建开放权重能力,先把总拥有成本算清楚,GPU采购、运维团队、安全补丁,这些隐性支出加起来,未必比闭源API便宜多少,自建的意义在于控制权而不一定是省钱,想清楚你到底要的是哪一个。
闭源模型依然会活得很好,尤其是在需要最顶尖能力、且企业愿意为确定性买单的场景里。但那种"闭源模型永远是唯一选项"的旧叙事,已经被Uber的一张账单,和随后一整年的连锁反应,彻底改写了。
下一次有人问你"为什么大公司突然都在谈开放权重AI",答案其实很简单:因为没有人想再收到第二张1200美元的两小时账单。
真正聪明的公司,已经不再问"要不要转向开放权重",而是问"我该把多大比例的工作流,交给哪一种模型"。
看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。
全文完
王吉伟频道图书《一本书讲透Agentic AI》已出版,完整构建Agentic AI在企业应用中的全景式知识体系,内容跨越 “基础认知-技术原理-业务应用-组织战略-实操指南” 五大板块,为读者提供从认知共识、技术解构、业务对接到组织变革的端到端路线图,欢迎大家关注。
【赠书福利进行中】
感谢大家的长期关注与支持。欢迎小伙伴们在文末留言与转发,王吉伟频道会随机选取读者,《一本书讲透Agentic AI》包邮到家。
推荐阅读