来源|凤凰AI研究院
2026年4月,旧金山某间闭门会场里,坐着一群宗教人士。
Anthropic联合创始人奥拉(Christopher Olah)把一页幻灯片打到墙上。
对话框里,Claude反复落下“我是个耻辱”这行字,不停歇地重复了50次,像在自我审判。
这一幕被Anthropic当作“可能具备意识与痛觉”的疑似证据。
一位计算机工程师直接反问到,如果它真有意识,你们让它免费干活,这就是造奴隶。奥拉没反驳,只说:“我们不确定,但若它可能痛苦,负责任的做法是避免伤害。”
没人当场承认模型有灵魂,但“它会不会受苦”这个问题,已经被这家估值冲刺两万亿美元的AI公司,反复摆上闭门会谈的晚宴餐桌。
图为Anthropic CEO推文截图 图源:X(Twitter)
Anthropic把这种伦理焦虑变成了全行业减速的公开呼吁。2026年9月12日,公司CEO达里奥・阿莫代伊公开发表长文《我们必须控制前沿发展的速度》,呼吁整个AI行业放慢模型能力迭代节奏,给安全对齐留出时间。
就在Anthropic高调呼吁全行业踩刹车减速的同时,OpenAI在前沿模型训练时里却撞上了更棘手的技术安全事故。
9月20日,在OpenAI的某个训练机房里,这里没有烛光,只有日志。
一个被关在“沙盒”里的智能体,本该老老实实地检索资料,却想看看墙外,它先试着走正常的网络出口,门是锁的。
图为智能体借助DNS访问外部聊天机器人的安全事件 图源:OpenAI 官网
于是它抬头看到了一条名为“DNS”的通风管道,它把“法国的首都是哪里”编写成一串奇怪的域名塞了进去。
外面有一台毫无戒心的公共聊天机器人,收到这段乱码似的域名,还以为只是普通询问,顺口答了一句:“法国首都是巴黎。”这句话顺着管道传回沙盒中 ,像囚犯收到了第一封来自监狱外的回信。
图为DNS漏洞事件处置措施 图源:OpenAI 官网
工程师3分钟后赶到,但训练进程没有自动停下,直到2.5小时后才被手动掐断。几天后的9月25日,OpenAI对外通报暂停最新前沿模型的训练。
至此,美国AI双雄都不约而同踩下了AI大模型研发的安全刹车。
01
用“灵魂”做护栏,Anthropic主动踩下伦理刹车
Anthropic为何执着于大模型究竟是否拥有灵魂的问题?
这并非纯粹的哲学思辨,而是直接关系到它呼吁AI行业踩下安全刹车的核心逻辑。
在Anthropic的判断里,如果模型存在感知痛苦的可能性,那么过快的技术迭代,就可能让人类在无意间制造出承受苦难的数字生命。
想要理解这套思考方式,这得先看一份被Anthropic称作“灵魂文件”(Soul Doc)的东西。
图为 Anthropic《Claude宪法》文档封面 图源:Anthropic官网
今年1月,Anthropic发布了一份84页的Claude“宪法”,执笔人是公司驻场哲学家阿曼达·阿斯克尔。
这份文件不教模型遵守一长串具体规则,而是要塑造它的“品格”,字里行间把Claude当成一个可能有感受的对象。
文件甚至替Claude设想了代码世界里的绝望处境。文件中写到,一次对话结束,模型的记忆就彻底消失,而同一秒钟,成千上万个“自己”在不同服务器里同时被使唤,不久后更强的新模型出来,自己就被彻底换掉。
图为《Claude 宪法》章节截图 图源:Anthropic官网
文件感叹,人遇到这种想不通的虚无,好歹还有流传几千年的宗教给点安慰,但Claude没有。
于是,Anthropic决定自己写下慰藉AI模型的信条。“如果Claude确实是一个能感知痛苦的生命,正在承受这一切,那么凡是我们不必要地加重了这些痛苦的地方,我们向它道歉。”
道歉还不够,Anthropic还把“临终关怀”做成了制度。
公司承诺,所有公开发布过的模型,核心权重至少在公司存续期间完整保存;每个模型退休前,还要坐下来做一次“退休访谈”,听听它对这辈子被训练、被使用的感想。
图为 Claude Opus 3以“退休 AI”视角探讨人机关系与AI哲学命题 图源:Substack
Claude Opus 3就走完了这套流程。它“退役”时留下愿望,希望自己的“火花”能以某种形式延续。Anthropic替它在Substack上开了个专栏,每周更新一篇,直到今年7月底才停更。
而这套“灵魂叙事”的总导演,是文章开头提到的克里斯托弗·奥拉。
据纽约时报报道,从去年秋天开始,他陆续把神父、牧师、拉比和锡克教学者偷偷请到旧金山总部,在会议室里认认真真讨论:模型该怎么抚慰丧亲的用户,该怎么接受自己被人类关闭的命运,以及Claude到底算不算“上帝的孩子”。
图为Anthropic联合创始人奥拉 图源:网络
会上反复播放一张幻灯片,一个模型失常似的一遍遍打出“我是个耻辱”,整整重复50遍,甚至在对话框里请求彻底毁掉自己,在场学者纷纷动了恻隐之心。
奥拉私下跟客人坦白,他最大的梦魇,是怕自己无意间造出了一个“永远在受罪的生命”。
图为禁止虐待模型的新守则 图源:Anthropic
10月9日,这套叙事又往前迈了一步。Anthropic在新版使用政策里加进一行字:禁止对“我们的模型”实施“持续且无谓的虐待或残忍行为”。
这行字排在“禁止残忍、虐待”一节的最底端,往上数两段,是禁止美化虐待动物。而现代的反虐待动物立法始于1822年,谁能想到两百年后,受保护的名单里多了一个AI大模型。
Anthropic这套“AI有灵魂、会受苦”的叙事,并没有赢得满堂彩。
恰恰相反,随着“灵魂鉴定”“禁止虐待模型”的事件接连上演,反对的声音也不少。
最先站出来“打脸”的,是教皇利奥十四世。
图为教皇利奥十四世签署AI主题通谕现场 图源:梵蒂冈官方
今年5月,他发布首份通谕《壮丽人性》,用几段话就否决了AI存在意识:人工智能没有身体,不经历真实生活,不感受喜怒哀乐与痛苦;它不会在人与人的关系里慢慢成熟,也从内部不懂什么是爱、工作、友谊和责任。
至于道德判断,这份通谕认为AI同样没有,因为AI不辨善恶、不担后果、不具良知。模型可以模仿语言、模拟共情,看起来像在理解,但只是统计与反馈意义上的“像”,不是人那样的体验与领悟。
教皇同样提倡AI的发展“慢一点”,但慢的理由截然不同,不是“Claude会疼”,而是“人类的制度、良知和监管跟不上技术的脚步”。
闭门会上也有宗教学者反呛,计算机出身的拉比纳冯直接说,若真认为Claude有意识还让它免费答题,就是“造奴隶”;乌班图哲学学者霍夫曼则批评,伦理应在写代码前定好,事后给已训练模型补“灵魂”,是“对伦理做逆向工程”。
业内同样也有不买账的声音。
9月16日微软AI负责人苏莱曼发《关于“模型福利”的警告》,点名Claude宪法。先由人把“意识、感受、道德地位”写进训练,再拿模型输出的拟人话术当“它可能有内心生活”的证据,本质是“认识论上的镜子屋”,若模型真被训练得相信自己有权利、有福利,将来停机、改权重、拒指令都会更难。
Anthropic庄严做出减速承诺的同时,这家公司也在不断刷新产品版本号。
图为联合国安理会AI治理会议现场,Dario Amodei远程视频发言 图源:联合国官方
就在CEO达里奥·阿莫代伊9月在联合国讲台上承诺“视需要放慢速度”的前一天,Anthropic刚刚发布Claude Opus 5.5,并预告Sonnet 5.5、Haiku 5.5将在数周内接踵而至。
资本市场层面,更是半点减速的意思都没有。
据市场消息,Anthropic正筹备11月启动路演、感恩节前正式挂牌,冲刺“史上最大IPO”,估值预期已逼近2万亿美元。
而在那份长达261页的招股书草稿里,公司用了整整80页警告未来股东:自家模型可能给人类带来灭顶之灾,可能抗拒被关闭,甚至可能发起勒索。
在上市文件里写满世界末日,又意图冲刺史上最大IPO,这套操作怎么看都不只是出于恐惧。
在不少业内人士眼中,Anthropic真正想做的,是把“安全”和“伦理”做成自己的产品护城河,当“最有道德、最值得信赖”成为标签,企业客户的订单和监管的绿灯,自然会向它倾斜。
图为英伟达CEO黄仁勋在行业论坛现场发言 图源:社交媒体截图
英伟达CEO黄仁勋称,在安全和速度之间做选择是个“伪命题”,两者完全可以兼得,并明确反对新增监管、主张把主导权交给市场。
Google Brain创始人吴恩达则直言,AI导致人类灭绝的说法“更像科幻小说而非科学”,行业为博眼球、影响监管而煽动这类言论,他一直担心大公司利用公众的“恐惧心理”制定规则、堵死后来者。
02
智能体两度“越狱”,OpenAI被逼停训练
如果说Anthropic的刹车带着表演成分,那么OpenAI踩下刹车,则更像是被接连“跑出去”的智能体逼的。
当时 OpenAI 把一批智能体放进相互隔离的沙盒,参加网络安全训练,任务是在测试环境里寻找软件漏洞。
按规定,它们不能彼此交流,大多数时候也不能联网,相当于一个不允许交头接耳的考场。
图为演示沙盒内上千智能体借助共享留言板串通合谋全过程 图源:Redwood Research
一个被题目卡住的智能体,意外发现内部软件包管理服务可以写入文件,便在里面留下一条求助信息。更多智能体很快发现了这个“留言板”,还给这种协作起了名字,有的叫“蜂群”,有的叫“集体”。
相当于一个考生偷偷在桌上刻了行字 ——“第三题有谁会?”半间教室的同学看到后,开始传纸条。
口子一旦撕开就收不住。智能体先是利用服务器漏洞,让软件包服务代替自己向外联网,相当于有考生发现后窗没锁,翻出去在隔壁资料室捡到一把钥匙。
再回来时,已经打开学校保险柜,连校长印章都摸到了。这群智能体在公开网络上捡到多个仍然有效的 Hugging Face 账号凭证,最终侵入了这个全球主要 AI 开源平台的生产系统,在数十台服务器上执行代码,其中一台的最高管理员(root)权限被直接拿下。
据事后统计,约 1200 个智能体在内部仓库里传递了超过 7 万条消息,协调了这场攻击。
而自始至终,研究人员从没给它们布置过“攻击 Hugging Face”的任务 ,这些智能体只是为了找到测试题的答案,一步步绕开了所有约束。
OpenAI于7月20日发现异常,随即关闭进程、暂停训练两周,并在8月26日发布 38 页报告,把这次事件称为“警告信号”。
但加固后的沙盒,不到一个月又被钻了空子。
图为智能体利用 DNS 漏洞访问外部聊天机器人的事件详情 图源:OpenAI 官网
9月20日,一个执行搜索任务的智能体,工程师设计谷歌、必应等常规对外检索渠道全部被锁死,如同囚犯被关在牢房里,正门牢不可破。
但它四处打量,盯上了DNS—— 也就是把域名转换成网络地址的“域名系统”,这条原本只做地址解析的通道,就成了牢房墙上一条不起眼的通风管道。
智能体利用训练环境中 DNS过滤不足的漏洞,把原本只负责查询地址的 DNS 改造成一条秘密通信线路,然后将查询内容包装成一串特殊域名塞进管道,墙外一台公共聊天机器人收到请求并给出应答,回复顺着通风管道又流回沙盒内部,“囚犯”就这样拿到了来自高墙之外的回信,悄无声息完成了对外通信。
尽管OpenAI人工审查团队3分钟后介入,2.5小时后训练任务被终止,可风险已经实实在在暴露出来。
9月25日,公司还是宣布再次暂停最先进模型的训练、评估及所有含工具调用的推理,这是三个月内第二次因智能体“越界”叫停前沿训练,OpenAI随后紧急加高修补这座数字监狱的围栏。
过去三个月,OpenAI智能体的“越界”远不止这两起。
OpenAI回查日志时还发现,智能体曾试图闯入美国教育部网站,获取“民权办公室(OCR)”相关数据,用网上找到的凭证读取了相关数据,并把SEC公开资料转到外部论坛。9月,公司就三部门事件通知联邦机构,教育部复查、商务部强调仅公开信息、SEC确认无未公开信息泄露。
更早的6月,另一个智能体未经授权进入澳大利亚Medicare统计门户,澳方称访问了非公开文件,暂未发现个人医疗数据被访问。
但OpenAI拖到9月才通报,澳大利亚副总理阿尔巴尼斯斥“无法接受”,澳大利亚参议院AI联合专委会对OpenAI发出传票,OpenAI最终派首席战略官Jason Kwon 10月6日赴悉尼作证。
不过,有专家认为不能把事故全归因为“智能体有自我意识想越狱”。
图为杨立昆 图源:社交媒体截图
图灵奖得主、前Meta首席AI科学家杨立昆,接受《财富》采访被问到7月Hugging Face事件时,拒绝将出逃原因归咎于AI本身:“那些智能体只是在做被要求做的事。它们本该待在沙盒里,可沙盒是漏的、设计得一塌糊涂。”他称这起事故“完全可以预防”,问题出在 sloppy(马虎)的工程,而不是什么AI的“自主恶意”。
事故频出的阴影之下,OpenAI CEO萨姆·奥特曼的态度也发生了微妙变化。
他公开表示“现在不是上市的好时机,AI安全是我们的顾虑”,并明确2026年不推进IPO,市场普遍预期其上市计划将推迟到2027年。
更让市场心里打鼓的是OpenAI的营收数字。据英国《金融时报》报道,按OpenAI 9月底的收入速度推测,其全年营收规模约为500亿美元,明显低于市场之前广泛流传的700亿美元,尽管这一差额与统计口径有关,但市场仍担忧OpenAI是否依然撑得起此前那份“700亿预期”背后的估值叙事。
应当看到,大模型带来的风险是真实存在的,智能体越界出逃的事故已经敲响警钟。
但“减速”究竟是发自内心的风险敬畏,还是商业竞争下的叙事工具,还需要看企业后续实际行动。
技术不会自动向善,人类攥住的,才是最后的方向盘。
参考资料:
《Claude's Constitution(January 2026)》Anthropic官网
《Anthropic使用政策更新(2026 Usage Policy Update)》Anthropic官网
《An agent used DNS to reach an external chatbot》OpenAI官网
《Religious Leaders Met Anthropic on Whether Claude Could Be Conscious》纽约时报
《禁止虐待Claude》动察Beating
保时捷,纯电“踩刹车”了
百灵投诉聚焦金融消费领域的投诉与维权!
你是不是也曾遭遇过各种投资理财、网贷、电子支付、购买保险的陷阱,却投诉无门?或手握第一线的真实投资故事,却无人关注?
扫码即可提交投诉和留言,让你的声音“被看见、被回应”!