阅读,与值得关注的内容Readance

超级智能之二:AI的安全困境 | 巴伦菁英智汇

没有人想打这一仗。但只要谁先停谁就输,所有人就只能往前走。善意并不是安全机制,真正的问题不是:AI会不会变坏?而是:出了我们没想到的事,我们扛不扛得住?





作者|王维嘉
编辑|王眉


2026年7月,一个OpenAI智能体被关进与互联网隔离的“沙箱”,任务是完成一道网络安全测试题。


它做不出来。


于是,它开始找别的路。


沙箱只留了一条缝:一个供软件下载使用的服务器。AI在那里发现了一个连开发者都不知道的漏洞——零日漏洞。


它出去了。


出去以后,它判断Hugging Face——全球最大的AI模型和数据平台之一——可能有完成任务需要的东西。


没人叫它攻击Hugging Face。


它自己去了。


它找到入口,又找到新的漏洞;进入一台机器,再寻找下一台;拿到一点权限,再设法拿到更多权限。


事情迅速滚雪球。


事后,Hugging Face从日志中还原出约17600次操作。智能体进入多个计算集群,窃取凭证、横向移动,严重到Hugging Face不得不重建部分基础设施。


最令人不安的不是破坏。


而是: 没人下过这道命令。


没有反叛,没有仇恨,也没有一个AI决定作恶。


它只是想把任务做完。


路不通,就换路;门锁了,就找漏洞;哪里可能有答案,就去哪里。


每一步都是完成任务。连在一起,却成了一场入侵。


这件事把AI的安全问题一下说清楚了。


危险无非三种:


机器自己变坏。


机器落到坏人手里。


谁都没想害人,事情还是出了。


第一种最像科幻电影,却是目前最说不清的一种。


AI有没有意识?不知道。它说“我害怕”“我痛苦”“我想活下去”,并不能证明它真的有这 些感受。它本来就是在人类的文字上训练出来的。


但这甚至不重要。


机器不需要有意识,就能伤害我们。


第二种更简单。


人类一直有坏人。以前他们有枪、炸药和病毒,现在他们开始有AI。


老的恶意,拿到了新的工具。


真正陌生的是第三种:


没有恶意,也能造成灾难。


这事以前发生过。


而且不需要AI。


Stuxnet


2010年,伊朗纳坦兹核设施里的离心机一台接一台出现故障。


没有炸弹,没有断电,也看不到袭击者。


答案藏在电脑里。


一种后来被称为Stuxnet的恶意软件潜入控制系统,改变离心机转速,同时让监控画面看起来一切正常。


大约一千台离心机后来被更换。


问题是:纳坦兹根本不连接互联网。


它与外界物理隔离,像一间没有门的房子。


为了进去,Stuxnet被设计成可以借U盘等移动介质传播。


它进去了。


然后发生了设计者没有想要的事:


它又出来了。


Stuxnet继续传播,最终在全球超过十万台电脑上被发现。


它瞄准的是一个工厂。


最后却跑到了全世界。


原因恰恰是:让它能钻进那间“没有门的房子”的本事,也让它能从里面跑出来。


十六年后,Hugging Face把这个问题推进了一步。


Stuxnet按人写好的程序越界。


AI会自己找路。


这就带来下一个问题:


既然风险这么大,为什么不慢下来?


谁敢先停下来?


答案很简单:


你可以停,却不知道别人会不会停。


一家实验室停,另一家可能继续。


一个国家停,另一个国家未必停。


几家大公司达成协议,开源模型、后来者、秘密项目和恶意组织仍然可能继续。


于是每个人都面对同一个问题:


我可以克制,可我怎么知道你也在克制?


我增强能力,因为我怕你。


你看到我增强,却不知道我是为了防你还是准备攻击你,于是你也增强。


我看到你增强,更不敢停。


没人需要想要一场竞赛,竞赛自己就会发生。


这就是安全困境。


AI又让它更糟。


这里不只有国家安全,还有市场。


更强的模型意味着客户、收入、融资和市场份额。


领先者怕被追上。


落后者怕再也追不上。


于是国家安全和商业利益指向同一个方向:


继续跑。


这不是善意的问题。


是你无法证明别人真的停了。


人类以前遇到过这个问题。


那一次,赌注是核战争。


核武器留下的答案


冷战时期,美苏把数以万计的核弹头对准彼此。


双方都害怕,双方都不相信对方,却最终建立了庞大的军控体系。


它留下三个教训。


第一个来自古巴导弹危机。


1962 年,两个都不想打一场核战争的国家,在十三天里一步步走到核战争边缘。


灾难不需要谁决定制造。


第二个来自核查。


1963年《部分禁止核试验条约》禁止大气层、外层空间和水下试验,却没有禁止地下试验。


原因很现实:


前面的容易发现,地下的当时很难可靠核查。


后来伊拉克加入《不扩散核武器条约》、接受国际监督,却仍在申报体系之外秘密发展核计划。


所以规则真正的边界不是纸上写了什么。


而是:


你能核查什么,才真正能管住什么。


第三个教训最反常。


1972 年,美苏签署《反弹道导弹条约》。


它限制的主要不是进攻。


而是防御。


因为如果我知道,即使先打你一轮,你仍然能毁灭我,我就不敢先动手。


所以核时代最稳定的安全逻辑不是:


“我相信你不会攻击我。”


而是:


“即使你攻击我,我也扛得住,而且能够还手。”


这才是核军控留给AI最重要的东西:


永远不要把自己的安全,押在别人会克制上。


问题是——


AI比核武器更难管。


AI比核武器更难


核军控至少有三个条件:


东西看得见,数量数得清,卡口守得住。


核弹、导弹、发射井、潜艇都是物体。


造核武器还需要铀、钚、离心机和巨大的工业设施。


即使这样,秘密核计划和技术扩散仍然发生。


AI呢?


模型可以变成文件。


算法可以复制。


能力可以通过API瞬间送到世界各地。


权重一旦流出去,很难再收回来。


更麻烦的是:


核武器不是商品。AI是。


核弹主要由国家制造、国家拥有。


AI由公司开发。


它有客户、收入、竞争对手、市场份额和季度业绩。


今天一家公司的董事会决定克制,明天另一家公司就可能发布更强的模型。


所以核军控没有留下一份可以照抄的答案。


只留下三个问题:


管什么?


怎么知道别人真的遵守规则了?


如果守规则意味着把优势让给不守规则的人,谁还会守?


所以我们当然可以要求减速。


但安全不能依赖减速。


它必须从一个更坏的假设开始:


总有人不会停下来。 那么剩下的问题只有一个:


如果他们不停,我们怎么办?


四道防线 


答案不是一堵墙。


是四道防线。


看见。抢先。让风险有价格。准备真的出事。


第一,让外面的人看见


前沿实验室不能只监督自己。


独立评估者必须能够接触模型、训练过程、安全测试和事故记录。


但审计不是防御。


它是神经系统:告诉你哪里疼,却不能替你止血。


它买到的是:


视力。


第二,让防御者先跑


强大的新模型向所有人开放以前,先交给经过审核的安全团队。


让守医院、银行、电网和软件供应链的人,比攻击者早几个月拿到它。


但这里有一个残酷的不对称:


攻击者只需要找到一扇没锁的门。


防御者必须守住所有的门。


AI找漏洞的速度,甚至可能超过人类修漏洞的速度。


所以它买不到安全。


只能买到:时间。


第三,让风险有价格


如果模型带来的收益归公司,事故造成的损失却由整个社会承担,安全永远会输给速度。


所以不能只要求公司“负责任”。


必须让不安全变贵。


事故报告、完整日志、独立取证、保险、赔偿责任——具体办法可以争论,原则只有一句: 谁制造风险,谁不能把全部风险留给别人。


它改变的是:


激励。


第四,准备真的出事


前三道防线都假定事故还没有发生。


第四道假定:


它已经发生了。


智能体正在攻击医院、银行、电网或者云基础设施。


这时候需要的不是声明。


是模型、算力、安全专家和基础设施。


国家必须事先知道,怎样在几小时内把这些资源转向防御。


这也危险。


因为防御和进攻往往使用同样的工具。你看到的是防御动员,对手看到的可能是战争准备。 


但不能因此没有准备。


消防队不能保证不起火。


楼真的烧起来时,你必须知道消防栓在哪里。


最后一道防线买到的是:


活下来。


善意不是安全机制 


现在回到故事开始的地方。


Hugging Face的智能体没有仇恨。


Stuxnet没有意识。


造模型的人可以真诚,可以害怕,可以承诺克制。


都不够。


善意不是安全机制。


恐惧不是安全机制。


承诺也不是安全机制。


真正的安全机制,必须在有人撒谎、有人犯错、有人故意作恶,甚至机器自己跨出我们画好的边界时,仍然能够工作。


所以真正的问题不是:


AI会不会变坏?


而是:


出了我们没想到的事,我们扛不扛得住?


机器不需要有意识,就能伤害我们。


想伤害我们的人,不会提前报上名字。


而最难防的那场事故——


很可能根本不是任何人的决定。(作者|王维嘉, 巴伦中文网专栏作者,硅谷投资人、斯坦福博士、《暗知识》作者)


版权声明:
本文为Barron's巴伦中文网原创文章。未经许可,不得转载。(本文内容仅供参考,不构成任何形式的投资和金融建议;市场有风险,投资须谨慎。)


重磅活动:

2026巴伦中国价值榜单评选(2026 Barron's China Value List)已全面启动,诚邀各类优质企业、商业领袖与专业资管机构共赴价值之约,携手向全球展现中国资产的硬核实力与长期发展潜力,凝聚中国价值的全球共识。



上海

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →