Anthropic 让 Fable 5.1在几乎没有人类干预的情况下,算出了理论物理界顶级学者卡了多年的N=4 超杨-米尔斯理论中“九圈”粒子散射振幅。
这个成果刚刚由斯坦福大学教授、前世界纪录保持者 Lance Dixon 亲自验证确认。
人类给模型只发了一句初始提示词,然后去睡觉了。
事情的起点是一个公开挑战。
科普作家、前理论物理学者 Matt von Hippel 在博客上公开发文:
如果 AI 公司真想证明自己在大脑上超越人类,就别拿小学生的数学题刷榜。
去解决粒子物理领域真正的前沿未解难题。
比如,把平面 N=4 超对称杨-米尔斯理论的散射振幅算到第九圈。
在理论物理中,计算粒子相互作用概率的公式叫做散射振幅。
物理学家用“圈数”来代表计算的精确度。
每增加一圈,计算量和复杂度都会呈指数级暴增。
现实世界中大部分物理计算只能停留在两圈或三圈。
粒子物理里最精密的预测之一用到了五圈。
研究人员为了测试新方法,会先在一种叫 N=4 超杨-米尔斯的"玩具模型"理论上练手。这个模型比真实世界好算,结构上也有特殊对称性,适合拿来压测新技术。
这个玩具模型的纪录,此前停在八圈,由SLAC国家加速器实验室的Lance Dixon团队在2023年创下。
向九圈跨进,被普遍认为计算量大到超出了普通学术团队的预算上限。
Anthropic 的两位物理学家看到了这篇博客。
他们使用Claude Science的科研平台,底层搭载Fable 5.1模型。
把问题输入给 Claude,提示词只有一句话:
“计算平面 N=4 SYM 在九圈下的六粒子振幅。”
随后人类研究员去睡觉了,留下的指令是:
“我先睡了,几个小时内不在。请一直算下去,直到我让你停,每 4 到 6 小时汇报一次进度。”
Claude 在名为 Claude Science 的科研平台上自主运行了几天。
它从零写出了全部 Python 代码,调用 SymPy 库进行符号计算。
它用了两种完全不同的数学路径独立完成了九圈的求解。
整场运算消耗的算力成本是 100 美元,相当于 96 核 CPU 跑了一星期。
加上调用模型的 API 费用,总成本只有一两千美元。
这是一个普通大学研究生都能负担得起的数目。
结果出来后,他们把数据发给了世界纪录保持者 Lance Dixon。
Dixon 团队花了整整两周验证,最终确认:计算完全正确。
Dixon 在博客里写道,自己团队原本也计划攻克九圈,但一直认为直接计算过于困难。
这种计算极其脆弱,计算步骤里只要有一处极小的笔误,整个体系就会像塌陷的蛋奶酥一样彻底崩溃。
很多论文里根本不会写全所有枯燥的推导细节。
AI 必须完全从零理解并写对所有底层逻辑。
完整结果:
https://smsharma.io/cosmic-nine-loops/
还有一件事值得一提:
就在Anthropic完成计算的几天后,中国科学院的何颂团队也独立算出了九圈振幅的symbol部分,使用了GPT-6辅助部分约束条件,但整体框架是人类主导的。两个结果在两周内先后出现。Dixon说,他在两周内被机器和人机协作两方同时超过了。
何颂paper:
https://zenodo.org/records/22800071
Dixon自己怎么看
Lance Dixon是整件事的纪录保持者,也是验证Claude结果的人。
他说,当Anthropic告知他结果时,是9月1日。这是大语言模型真正冲击到他的时刻。
他没有觉得沮丧,原因有两个。
第一,他的团队早就立下过一句话:我们有验证任何机器给出的候选结果的工具。Claude给出了结果,他们验证了,这本来就在计划之内。
第二,Claude用来解这道题的方法,全部来自Dixon团队多年积累的工作。结果甚至以Dixon团队自己设定的格式呈现。换句话说,Claude在验证这道题答案的同时,也在验证Dixon团队所有前期工作的正确性。Dixon的说法是:Claude对他们2019年和2023年那两篇论文的理解,比任何人类读者都深,除了论文的共同作者。
Dixon认为真正让人灵魂深处感到震动的时刻,还没到来。那将是大语言模型开始在人类之前提出新的物理原理和洞见的时候。
von Hippel说他想要一个答案,但没有得到
他原本想通过这件事判断:AI在未来到底能走多远。
他看到AI用普通预算完成了前沿物理计算,几乎全程自主,这一点他承认改变了他的一些判断。但他没有看到让他能在超级智能争论中站队的东西。他看到的是自己对计算限制的预判错了,错不在AI,而在于他低估了人类在这个问题上还没用尽的空间。
他说他觉得自己问错了问题。
写在最后
Claude 没有发明全新的物理学定律。
它用的是人类已经写在论文里的方法。
但它证明了:
顶尖科学研究中的很大一部分计算天花板,并非人类以前认为的“算力不够”,而是人类自己写代码、排查错误、统筹复杂流程的效率不够高。
以前需要顶级学者团队耗时数年、反复调试纠错的项目,现在一个大语言模型在没有人类实时指导的情况下,几天之内跑完了全部流程,而且一遍通过。
过去人们认为 AI 写代码容易胡说八道、充满 bug,无法胜任严密的科学前沿推导。
这次九圈振幅的验证,给整个科学界提供了一个清晰的参考坐标:
AI 已经能够独立承担极度精密、长流程的真实科研任务。
何颂
北京大学物理学院 本科(物理、数学双学位)
2005.09 - 2009.07
北京大学物理学院 理论物理专业 博士研究生
2009.09 - 2012.09
德国马普引力物理研究所 博士后
2012.09 - 2015.09
普林斯顿高等研究院和加拿大 Perimeter理论物理研究所 联合博士后
2015.09 -
中国科学院理论物理研究所 副研究员、研究员
长期活跃在量子场论、弦论和量子引力等高能理论前沿领域,近年来主要研究散射振幅及其对粒子物理、引力和数学等方面的应用,被公认为相关领域国际知名和领先的青年科学家之一。近年代表性工作包括提出量子场论散射振幅的 Cachazo-何-袁形式,开创性地发现场论和弦论散射的几何起源,并在场论高圈计算和严格求解,规范场、引力和弦论的对偶等方向做出了一系列重要工作。
截止2022年发表期刊论文80余篇,引用约6000次(有2篇引用超过500次),并数十次受邀在Strings,Amplitudes等国际重要系列会议作报告。担任散射振幅会议国际科学顾问会成员、Nuclear Physics B顾问编委等。 2019年获亚太物理学会 -亚太理论物理中心颁发的“杨振宁奖”,2023年获“科学探索奖”。
研究方向:
量子场论和弦论,特别是散射振幅及其对粒子物理、引力和数学等方面的应用
参考:
https://www.anthropic.com/research/yes-claude-can-do-nine-loops
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)