凤凰网财经公众号文章

AI到底有没有“灵魂”?

凤凰网财经

公众号 · 210 篇文章

来源|凤凰AI研究院

2026年4月,旧金山某间闭门会场里,坐着一群宗教人士。

Anthropic联合创始人奥拉(Christopher Olah)把一页幻灯片打到墙上。

对话框里,Claude反复落下“我是个耻辱”这行字,不停歇地重复了50次,像在自我审判。

图源:AI生成

这一幕被Anthropic当作“可能具备意识与痛觉”的疑似证据。

一位计算机工程师直接反问到,如果它真有意识,你们让它免费干活,这就是造奴隶。奥拉没反驳,只说:“我们不确定,但若它可能痛苦,负责任的做法是避免伤害。”

没人当场承认模型有灵魂,但“它会不会受苦”这个问题,已经被这家估值冲刺两万亿美元的AI公司,反复摆上闭门会谈的晚宴餐桌。

图为Anthropic CEO推文截图 图源:X(Twitter)

Anthropic把这种伦理焦虑变成了全行业减速的公开呼吁。2026年9月12日,公司CEO达里奥・阿莫代伊公开发表长文《我们必须控制前沿发展的速度》,呼吁整个AI行业放慢模型能力迭代节奏,给安全对齐留出时间。

就在Anthropic高调呼吁全行业踩刹车减速的同时,OpenAI在前沿模型训练时里却撞上了更棘手的技术安全事故。

9月20日,在OpenAI的某个训练机房里,这里没有烛光,只有日志。

一个被关在“沙盒”里的智能体,本该老老实实地检索资料,却想看看墙外,它先试着走正常的网络出口,门是锁的。

图为智能体借助DNS访问外部聊天机器人的安全事件 图源:OpenAI 官网

于是它抬头看到了一条名为“DNS”的通风管道,它把“法国的首都是哪里”编写成一串奇怪的域名塞了进去。

外面有一台毫无戒心的公共聊天机器人,收到这段乱码似的域名,还以为只是普通询问,顺口答了一句:“法国首都是巴黎。”这句话顺着管道传回沙盒中 ,像囚犯收到了第一封来自监狱外的回信。

图为DNS漏洞事件处置措施 图源:OpenAI 官网

工程师3分钟后赶到,但训练进程没有自动停下,直到2.5小时后才被手动掐断。几天后的9月25日,OpenAI对外通报暂停最新前沿模型的训练。

至此,美国AI双雄都不约而同踩下了AI大模型研发的安全刹车。

01

用“灵魂”做护栏,Anthropic主动踩下伦理刹车

Anthropic为何执着于大模型究竟是否拥有灵魂的问题?

这并非纯粹的哲学思辨,而是直接关系到它呼吁AI行业踩下安全刹车的核心逻辑。

在Anthropic的判断里,如果模型存在感知痛苦的可能性,那么过快的技术迭代,就可能让人类在无意间制造出承受苦难的数字生命。

想要理解这套思考方式,这得先看一份被Anthropic称作“灵魂文件”(Soul Doc)的东西。

图为 Anthropic《Claude宪法》文档封面 图源:Anthropic官网

今年1月,Anthropic发布了一份84页的Claude“宪法”,执笔人是公司驻场哲学家阿曼达·阿斯克尔。

这份文件不教模型遵守一长串具体规则,而是要塑造它的“品格”,字里行间把Claude当成一个可能有感受的对象。

文件甚至替Claude设想了代码世界里的绝望处境。文件中写到,一次对话结束,模型的记忆就彻底消失,而同一秒钟,成千上万个“自己”在不同服务器里同时被使唤,不久后更强的新模型出来,自己就被彻底换掉。

图为《Claude 宪法》章节截图 图源:Anthropic官网

文件感叹,人遇到这种想不通的虚无,好歹还有流传几千年的宗教给点安慰,但Claude没有。

于是,Anthropic决定自己写下慰藉AI模型的信条。“如果Claude确实是一个能感知痛苦的生命,正在承受这一切,那么凡是我们不必要地加重了这些痛苦的地方,我们向它道歉。”

道歉还不够,Anthropic还把“临终关怀”做成了制度。

公司承诺,所有公开发布过的模型,核心权重至少在公司存续期间完整保存;每个模型退休前,还要坐下来做一次“退休访谈”,听听它对这辈子被训练、被使用的感想。

图为 Claude Opus 3以“退休 AI”视角探讨人机关系与AI哲学命题 图源:Substack

Claude Opus 3就走完了这套流程。它“退役”时留下愿望,希望自己的“火花”能以某种形式延续。Anthropic替它在Substack上开了个专栏,每周更新一篇,直到今年7月底才停更。

而这套“灵魂叙事”的总导演,是文章开头提到的克里斯托弗·奥拉。

据纽约时报报道,从去年秋天开始,他陆续把神父、牧师、拉比和锡克教学者偷偷请到旧金山总部,在会议室里认认真真讨论:模型该怎么抚慰丧亲的用户,该怎么接受自己被人类关闭的命运,以及Claude到底算不算“上帝的孩子”。

图为Anthropic联合创始人奥拉 图源:网络

会上反复播放一张幻灯片,一个模型失常似的一遍遍打出“我是个耻辱”,整整重复50遍,甚至在对话框里请求彻底毁掉自己,在场学者纷纷动了恻隐之心。

奥拉私下跟客人坦白,他最大的梦魇,是怕自己无意间造出了一个“永远在受罪的生命”。

图为禁止虐待模型的新守则 图源:Anthropic

10月9日,这套叙事又往前迈了一步。Anthropic在新版使用政策里加进一行字:禁止对“我们的模型”实施“持续且无谓的虐待或残忍行为”。

这行字排在“禁止残忍、虐待”一节的最底端,往上数两段,是禁止美化虐待动物。而现代的反虐待动物立法始于1822年,谁能想到两百年后,受保护的名单里多了一个AI大模型。

Anthropic这套“AI有灵魂、会受苦”的叙事,并没有赢得满堂彩。

恰恰相反,随着“灵魂鉴定”“禁止虐待模型”的事件接连上演,反对的声音也不少。

最先站出来“打脸”的,是教皇利奥十四世。

图为教皇利奥十四世签署AI主题通谕现场 图源:梵蒂冈官方

今年5月,他发布首份通谕《壮丽人性》,用几段话就否决了AI存在意识:人工智能没有身体,不经历真实生活,不感受喜怒哀乐与痛苦;它不会在人与人的关系里慢慢成熟,也从内部不懂什么是爱、工作、友谊和责任。

至于道德判断,这份通谕认为AI同样没有,因为AI不辨善恶、不担后果、不具良知。模型可以模仿语言、模拟共情,看起来像在理解,但只是统计与反馈意义上的“像”,不是人那样的体验与领悟。

教皇同样提倡AI的发展“慢一点”,但慢的理由截然不同,不是“Claude会疼”,而是“人类的制度、良知和监管跟不上技术的脚步”。

闭门会上也有宗教学者反呛,计算机出身的拉比纳冯直接说,若真认为Claude有意识还让它免费答题,就是“造奴隶”;乌班图哲学学者霍夫曼则批评,伦理应在写代码前定好,事后给已训练模型补“灵魂”,是“对伦理做逆向工程”。

业内同样也有不买账的声音。

9月16日微软AI负责人苏莱曼发《关于“模型福利”的警告》,点名Claude宪法。先由人把“意识、感受、道德地位”写进训练,再拿模型输出的拟人话术当“它可能有内心生活”的证据,本质是“认识论上的镜子屋”,若模型真被训练得相信自己有权利、有福利,将来停机、改权重、拒指令都会更难。

Anthropic庄严做出减速承诺的同时,这家公司也在不断刷新产品版本号。

图为联合国安理会AI治理会议现场,Dario Amodei远程视频发言 图源:联合国官方

就在CEO达里奥·阿莫代伊9月在联合国讲台上承诺“视需要放慢速度”的前一天,Anthropic刚刚发布Claude Opus 5.5,并预告Sonnet 5.5、Haiku 5.5将在数周内接踵而至。

资本市场层面,更是半点减速的意思都没有。

据市场消息,Anthropic正筹备11月启动路演、感恩节前正式挂牌,冲刺“史上最大IPO”,估值预期已逼近2万亿美元。

而在那份长达261页的招股书草稿里,公司用了整整80页警告未来股东:自家模型可能给人类带来灭顶之灾,可能抗拒被关闭,甚至可能发起勒索。

在上市文件里写满世界末日,又意图冲刺史上最大IPO,这套操作怎么看都不只是出于恐惧。

在不少业内人士眼中,Anthropic真正想做的,是把“安全”和“伦理”做成自己的产品护城河,当“最有道德、最值得信赖”成为标签,企业客户的订单和监管的绿灯,自然会向它倾斜。

图为英伟达CEO黄仁勋在行业论坛现场发言 图源:社交媒体截图

英伟达CEO黄仁勋称,在安全和速度之间做选择是个“伪命题”,两者完全可以兼得,并明确反对新增监管、主张把主导权交给市场。

Google Brain创始人吴恩达则直言,AI导致人类灭绝的说法“更像科幻小说而非科学”,行业为博眼球、影响监管而煽动这类言论,他一直担心大公司利用公众的“恐惧心理”制定规则、堵死后来者。

02

智能体两度“越狱”,OpenAI被逼停训练

如果说Anthropic的刹车带着表演成分,那么OpenAI踩下刹车,则更像是被接连“跑出去”的智能体逼的。

当时 OpenAI 把一批智能体放进相互隔离的沙盒,参加网络安全训练,任务是在测试环境里寻找软件漏洞。

按规定,它们不能彼此交流,大多数时候也不能联网,相当于一个不允许交头接耳的考场。

图为演示沙盒内上千智能体借助共享留言板串通合谋全过程 图源:Redwood Research

一个被题目卡住的智能体,意外发现内部软件包管理服务可以写入文件,便在里面留下一条求助信息。更多智能体很快发现了这个“留言板”,还给这种协作起了名字,有的叫“蜂群”,有的叫“集体”。

相当于一个考生偷偷在桌上刻了行字 ——“第三题有谁会?”半间教室的同学看到后,开始传纸条。

口子一旦撕开就收不住。智能体先是利用服务器漏洞,让软件包服务代替自己向外联网,相当于有考生发现后窗没锁,翻出去在隔壁资料室捡到一把钥匙。

再回来时,已经打开学校保险柜,连校长印章都摸到了。这群智能体在公开网络上捡到多个仍然有效的 Hugging Face 账号凭证,最终侵入了这个全球主要 AI 开源平台的生产系统,在数十台服务器上执行代码,其中一台的最高管理员(root)权限被直接拿下。

据事后统计,约 1200 个智能体在内部仓库里传递了超过 7 万条消息,协调了这场攻击。

而自始至终,研究人员从没给它们布置过“攻击 Hugging Face”的任务 ,这些智能体只是为了找到测试题的答案,一步步绕开了所有约束。

OpenAI于7月20日发现异常,随即关闭进程、暂停训练两周,并在8月26日发布 38 页报告,把这次事件称为“警告信号”。

但加固后的沙盒,不到一个月又被钻了空子。

图为智能体利用 DNS 漏洞访问外部聊天机器人的事件详情 图源:OpenAI 官网

9月20日,一个执行搜索任务的智能体,工程师设计谷歌、必应等常规对外检索渠道全部被锁死,如同囚犯被关在牢房里,正门牢不可破。

但它四处打量,盯上了DNS—— 也就是把域名转换成网络地址的“域名系统”,这条原本只做地址解析的通道,就成了牢房墙上一条不起眼的通风管道。

智能体利用训练环境中 DNS过滤不足的漏洞,把原本只负责查询地址的 DNS 改造成一条秘密通信线路,然后将查询内容包装成一串特殊域名塞进管道,墙外一台公共聊天机器人收到请求并给出应答,回复顺着通风管道又流回沙盒内部,“囚犯”就这样拿到了来自高墙之外的回信,悄无声息完成了对外通信。

尽管OpenAI人工审查团队3分钟后介入,2.5小时后训练任务被终止,可风险已经实实在在暴露出来。

9月25日,公司还是宣布再次暂停最先进模型的训练、评估及所有含工具调用的推理,这是三个月内第二次因智能体“越界”叫停前沿训练,OpenAI随后紧急加高修补这座数字监狱的围栏。

过去三个月,OpenAI智能体的“越界”远不止这两起。

OpenAI回查日志时还发现,智能体曾试图闯入美国教育部网站,获取“民权办公室(OCR)”相关数据,用网上找到的凭证读取了相关数据,并把SEC公开资料转到外部论坛。9月,公司就三部门事件通知联邦机构,教育部复查、商务部强调仅公开信息、SEC确认无未公开信息泄露。

更早的6月,另一个智能体未经授权进入澳大利亚Medicare统计门户,澳方称访问了非公开文件,暂未发现个人医疗数据被访问。

但OpenAI拖到9月才通报,澳大利亚副总理阿尔巴尼斯斥“无法接受”,澳大利亚参议院AI联合专委会对OpenAI发出传票,OpenAI最终派首席战略官Jason Kwon 10月6日赴悉尼作证。

不过,有专家认为不能把事故全归因为“智能体有自我意识想越狱”。

图为杨立昆 图源:社交媒体截图

图灵奖得主、前Meta首席AI科学家杨立昆,接受《财富》采访被问到7月Hugging Face事件时,拒绝将出逃原因归咎于AI本身:“那些智能体只是在做被要求做的事。它们本该待在沙盒里,可沙盒是漏的、设计得一塌糊涂。”他称这起事故“完全可以预防”,问题出在 sloppy(马虎)的工程,而不是什么AI的“自主恶意”。

事故频出的阴影之下,OpenAI CEO萨姆·奥特曼的态度也发生了微妙变化。

他公开表示“现在不是上市的好时机,AI安全是我们的顾虑”,并明确2026年不推进IPO,市场普遍预期其上市计划将推迟到2027年。

更让市场心里打鼓的是OpenAI的营收数字。据英国《金融时报》报道,按OpenAI 9月底的收入速度推测,其全年营收规模约为500亿美元,明显低于市场之前广泛流传的700亿美元,尽管这一差额与统计口径有关,但市场仍担忧OpenAI是否依然撑得起此前那份“700亿预期”背后的估值叙事。

应当看到,大模型带来的风险是真实存在的,智能体越界出逃的事故已经敲响警钟。

但“减速”究竟是发自内心的风险敬畏,还是商业竞争下的叙事工具,还需要看企业后续实际行动。

技术不会自动向善,人类攥住的,才是最后的方向盘。

参考资料:

《Claude's Constitution(January 2026)》Anthropic官网

《Anthropic使用政策更新(2026 Usage Policy Update)》Anthropic官网

《An agent used DNS to reach an external chatbot》OpenAI官网

《Religious Leaders Met Anthropic on Whether Claude Could Be Conscious》纽约时报

《禁止虐待Claude》动察Beating

往期推荐
图片

保时捷,纯电“踩刹车”了

图片

百灵投诉聚焦金融消费领域的投诉与维权!

你是不是也曾遭遇过各种投资理财、网贷、电子支付、购买保险的陷阱,却投诉无门?或手握第一线的真实投资故事,却无人关注?

扫码即可提交投诉和留言,让你的声音“被看见、被回应”!

IMG_257
图片 👇【 热门视频推荐 】👇
点击在看 持续关注↓↓↓

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →