阅读,与值得关注的内容Readance

突发!Anthropic宣布Fable 5.1仅用一条提示词突破粒子物理“九圈”难题


↑阅读之前记得关注+星标⭐️,😄,每天才能第一时间接收到更新


 

Anthropic 让 Fable 5.1在几乎没有人类干预的情况下,算出了理论物理界顶级学者卡了多年的N=4 超杨-米尔斯理论中“九圈”粒子散射振幅。

这个成果刚刚由斯坦福大学教授、前世界纪录保持者 Lance Dixon 亲自验证确认。

人类给模型只发了一句初始提示词,然后去睡觉了。

事情的起点是一个公开挑战。

科普作家、前理论物理学者 Matt von Hippel 在博客上公开发文:

如果 AI 公司真想证明自己在大脑上超越人类,就别拿小学生的数学题刷榜。

去解决粒子物理领域真正的前沿未解难题。

比如,把平面 N=4 超对称杨-米尔斯理论的散射振幅算到第九圈。

在理论物理中,计算粒子相互作用概率的公式叫做散射振幅。

物理学家用“圈数”来代表计算的精确度。

每增加一圈,计算量和复杂度都会呈指数级暴增。

现实世界中大部分物理计算只能停留在两圈或三圈。

粒子物理里最精密的预测之一用到了五圈。

研究人员为了测试新方法,会先在一种叫 N=4 超杨-米尔斯的"玩具模型"理论上练手。这个模型比真实世界好算,结构上也有特殊对称性,适合拿来压测新技术。

这个玩具模型的纪录,此前停在八圈,由SLAC国家加速器实验室的Lance Dixon团队在2023年创下。

向九圈跨进,被普遍认为计算量大到超出了普通学术团队的预算上限。

Anthropic 的两位物理学家看到了这篇博客。

他们使用Claude Science的科研平台,底层搭载Fable 5.1模型。

把问题输入给 Claude,提示词只有一句话:

“计算平面 N=4 SYM 在九圈下的六粒子振幅。”

随后人类研究员去睡觉了,留下的指令是:

“我先睡了,几个小时内不在。请一直算下去,直到我让你停,每 4 到 6 小时汇报一次进度。”

Claude 在名为 Claude Science 的科研平台上自主运行了几天。

它从零写出了全部 Python 代码,调用 SymPy 库进行符号计算。

它用了两种完全不同的数学路径独立完成了九圈的求解。

整场运算消耗的算力成本是 100 美元,相当于 96 核 CPU 跑了一星期。
加上调用模型的 API 费用,总成本只有一两千美元。

这是一个普通大学研究生都能负担得起的数目。

结果出来后,他们把数据发给了世界纪录保持者 Lance Dixon。

Dixon 团队花了整整两周验证,最终确认:计算完全正确。

Dixon 在博客里写道,自己团队原本也计划攻克九圈,但一直认为直接计算过于困难。

这种计算极其脆弱,计算步骤里只要有一处极小的笔误,整个体系就会像塌陷的蛋奶酥一样彻底崩溃。

很多论文里根本不会写全所有枯燥的推导细节。

AI 必须完全从零理解并写对所有底层逻辑。

完整结果:

https://smsharma.io/cosmic-nine-loops/

还有一件事值得一提:

就在Anthropic完成计算的几天后,中国科学院的何颂团队也独立算出了九圈振幅的symbol部分,使用了GPT-6辅助部分约束条件,但整体框架是人类主导的。两个结果在两周内先后出现。Dixon说,他在两周内被机器和人机协作两方同时超过了。

何颂paper:

https://zenodo.org/records/22800071

Dixon自己怎么看

Lance Dixon是整件事的纪录保持者,也是验证Claude结果的人。

他说,当Anthropic告知他结果时,是9月1日。这是大语言模型真正冲击到他的时刻。

他没有觉得沮丧,原因有两个。

第一,他的团队早就立下过一句话:我们有验证任何机器给出的候选结果的工具。Claude给出了结果,他们验证了,这本来就在计划之内。

第二,Claude用来解这道题的方法,全部来自Dixon团队多年积累的工作。结果甚至以Dixon团队自己设定的格式呈现。换句话说,Claude在验证这道题答案的同时,也在验证Dixon团队所有前期工作的正确性。Dixon的说法是:Claude对他们2019年和2023年那两篇论文的理解,比任何人类读者都深,除了论文的共同作者。

Dixon认为真正让人灵魂深处感到震动的时刻,还没到来。那将是大语言模型开始在人类之前提出新的物理原理和洞见的时候。

von Hippel说他想要一个答案,但没有得到

他原本想通过这件事判断:AI在未来到底能走多远。

他看到AI用普通预算完成了前沿物理计算,几乎全程自主,这一点他承认改变了他的一些判断。但他没有看到让他能在超级智能争论中站队的东西。他看到的是自己对计算限制的预判错了,错不在AI,而在于他低估了人类在这个问题上还没用尽的空间。

他说他觉得自己问错了问题。

写在最后

Claude 没有发明全新的物理学定律。

它用的是人类已经写在论文里的方法。

但它证明了:

顶尖科学研究中的很大一部分计算天花板,并非人类以前认为的“算力不够”,而是人类自己写代码、排查错误、统筹复杂流程的效率不够高。

以前需要顶级学者团队耗时数年、反复调试纠错的项目,现在一个大语言模型在没有人类实时指导的情况下,几天之内跑完了全部流程,而且一遍通过。

过去人们认为 AI 写代码容易胡说八道、充满 bug,无法胜任严密的科学前沿推导。

这次九圈振幅的验证,给整个科学界提供了一个清晰的参考坐标:

AI 已经能够独立承担极度精密、长流程的真实科研任务。

何颂

北京大学物理学院 本科(物理、数学双学位)

2005.09 - 2009.07

北京大学物理学院 理论物理专业 博士研究生

2009.09 - 2012.09

德国马普引力物理研究所 博士后

2012.09 - 2015.09

普林斯顿高等研究院和加拿大 Perimeter理论物理研究所 联合博士后

2015.09 -

中国科学院理论物理研究所 副研究员、研究员

长期活跃在量子场论、弦论和量子引力等高能理论前沿领域,近年来主要研究散射振幅及其对粒子物理、引力和数学等方面的应用,被公认为相关领域国际知名和领先的青年科学家之一。近年代表性工作包括提出量子场论散射振幅的 Cachazo-何-袁形式,开创性地发现场论和弦论散射的几何起源,并在场论高圈计算和严格求解,规范场、引力和弦论的对偶等方向做出了一系列重要工作。

截止2022年发表期刊论文80余篇,引用约6000次(有2篇引用超过500次),并数十次受邀在Strings,Amplitudes等国际重要系列会议作报告。担任散射振幅会议国际科学顾问会成员、Nuclear Physics B顾问编委等。 2019年获亚太物理学会 -亚太理论物理中心颁发的“杨振宁奖”,2023年获“科学探索奖”。

研究方向:

量子场论和弦论,特别是散射振幅及其对粒子物理、引力和数学等方面的应用

参考:

https://www.anthropic.com/research/yes-claude-can-do-nine-loops

 


--end--


最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →