9 月 4 日凌晨,OpenAI 发布新一代旗舰模型 GPT-6 Astra,总裁布罗克曼的发布会结语只有一句——「欢迎来到 AGI 时代」。
发布当天,OpenAI 同时宣布:GPT-6 Astra 把孪生素数问题的最好上界,从保持十二年的 246 推进到了 186,并附上了 条件式 Lean 形式化。
从 246 到 240,人类花了 12 年,
从 240 到 186,AI 只用了 3 天。
在聊接下来的一切之前,得先把这个纪录本身说清楚。
孪生素数猜想,是数论里最古老也最诱人的问题之一:像(3, 5)、(5, 7)、(11, 13)这样间隔恰好为 2 的素数对,究竟有没有无穷多对?
这个问题悬置了近两百年,至今没人能证明。
我们能做到的,是不断逼近它,证明「存在无穷多对素数,它们的间隔不超过某个固定的数 C」。C 越小,离猜想越近;当 C 等于 2,就等于证明了猜想本身。
GPT-6 这次做到的是:存在无穷多对间隔不超过 186 的连续素数。
虽然依旧还离「2」很远,但把人类保持十二年的最好上界(246)往前推了一大步。
换句话说,GPT-6 这次的突破,是在人类数学共同体铺好的轨道上,跑出了新的速度。
一周内,纪录被突破三次
这条线的来路,本身就是一部微缩的现代数论史:
2013 年
华裔数学家张益唐教授一鸣惊人,把间隔上界从「平均尺度内」直接压到 7000 万。
随后
James Maynard 和陶哲轩等发起 Polymath 项目,将这个间距一路狂砍到了 246。然而,到了 246 之后,原有方法似乎达到极限。
2026 年 8 月 31 日|246 → 240
2026 年 9 月 3 日早晨|240 → 212
AI 数学初创团队 Axiom 宣称,在 Stadlmann 的基础上,他们的 AI 系统 AxiomProver 将界限压缩至 212。
仅仅几个小时后|212 → 186
OpenAI 宣布:GPT-6 给出的最新纪录是 186。
人类守了十二年的纪录,一周内被 AI 突破三次,奇点好像真的来了?
统计学的「诺贝尔奖」,颁给了一个给 AI 打地基的人
官宣这一结果的 OpenAI 研究员,不是别人,正是刚拿下 2026 年「统计学的诺贝尔奖」COPSS 会长奖的苏炜杰。
他现任宾夕法尼亚大学沃顿商学院统计与数据科学系教授,和前段时间得了菲尔兹奖的邓煜、王虹一样,都来自北大数院。
COPSS 会长奖由美国统计协会、国际数理统计学会、加拿大统计学会等五大国际统计学会联合设立,每年只授予一位 40 岁以下的青年统计学家,被誉为「统计学的诺贝尔奖」。
上一个拿到它的华人,是 2012 年的寇星昌,中间隔了整整 14 年。
2026 年 2 月考普斯奖获奖名单揭晓三个月后,苏炜杰宣布在沃顿商学院学术休假期间加入人工智能领军企业 OpenAI。
履历是够硬的,但其实这几年搞 AI、搞大语言模型的人多如牛毛,这个奖凭什么是他?
根据获奖致辞,苏炜杰因在生成式人工智能统计基础、隐私保护数据分析、机器学习同行评审、凸优化、深度学习理论及高维推断等方面的贡献获奖。
简单来说,统计学界把今年的最高荣誉,发给了一个专门研究「怎么分清 AI 写的和人写的」的人。
他干的事情,跟那些比拼谁的模型参数更多、谁的算力更猛的人,完全不是一个方向。
一句话概括:给大模型打统计学地基。
01|大模型水印
怎么在 AI 生成的文本里嵌入一个可检测、又不破坏流畅度的统计信号?通俗说,就是微调模型选词的概率——让某个词从 50% 变成 51%,单看一个词毫无破绽,可积累几百个词、跑一遍统计检验,AI 的痕迹就藏不住了。
02|对齐与幻觉
为了让模型「说人爱听的话」,人类反馈强化学习(RLHF)反而让它学会了不懂装懂、一本正经地胡说八道。苏炜杰研究用统计工具评估和修复这些对齐机制里的漏洞,回答「AI 到底能不能信」。
03|高斯差分隐私
数据用得好就难免泄露隐私,保护到位又变成废码。他在两难之间找数学上的平衡点。这项技术甚至被用在了 2020 年美国人口普查里,让 3.3 亿人的数据能对外发布统计结果,又无法反推出任何个人。
统计学界把今年的最高荣誉,颁给了一个去 OpenAI 给大模型打地基的人;而与此同时,菲尔兹奖得主陶哲轩,也许正在花好几天时间,消化一份 AI 写出来的证明。
这两个画面放在一起,才是 2026 年数学界真正的发展底色。
这一年,AI 推动了哪些数学猜想?
回看过去这一年,AI 对数学猜想的冲击,其实是一条可以用日期清清楚楚标出来的时间线。
2025.10|一场乌龙
OpenAI 研究员宣布用 GPT-5 一个周末连破 10 道「百年悬案」级的埃尔德什难题,结果 DeepMind 的 Demis Hassabis 只回了一句「this is embarrassing」。
原来 GPT-5 只是搜到了早就存在、只是不太出名的旧论文。
知乎答主 @酱紫君 当时就点破:「AI 知道 = AI 做出来了,至于是别处抄的还是自己想的别管。」
2026.05|第一记「推翻」
OpenAI 一个内部通用推理模型,推翻了埃尔德什 1946 年提出的平面单位距离猜想,还给出了比埃尔德什预估更好的构型,并且经外部数学家核验通过。
知乎答主 @Fyx1123581347 感慨:AI 的解法人类并非完全没想到,只是没人推得下去,「AI 在这方面比人类强很多,不会像人一样知难而退」。
2026.07|87 年的猜想被「证伪」
Anthropic 的 Alpöge 用 Fable 5 找到了一个一页纸就能写完的反例:一个雅可比行列式恒为 -2、却把三个点映到同一个点的多项式映射。
知乎答主 @Nicolas Keng 很冷静:「反例问题在固定 ansatz 以后,很多条件可以变成代数方程,这种任务天然适合计算搜索……这件事很大,但不该神化 AI。」
他还顺带澄清了一个被传歪的细节:张益唐当年博士论文做的是雅可比猜想的二维情形,而 AI 找到的是三维反例,二维至今仍是开放问题。
2026.08.05|第一个完整闭环
一家初创公司的 CEO Lech Mazur,用 GPT-5.6 Pro 证明了悬置 67 年的森多夫猜想,附上约 9 万行的 Lean 4 形式化。
2026.08.10|黎曼猜想下界提高
Anthropic 宣布将黎曼猜想的已知下界从 41.6% 提高到了 67.2%。
2026.08 下旬|一个更大胆的构造
Alpöge 挂出一份 108 页手稿:用 Claude 构造了一个与六维球面 S⁶ 微分同胚的复三维流形,试图回答 Hopf 1948 年留下的「S⁶ 是否有复结构」。
2026.08 底|大素数间隙纪录改写
GPT-5.6 Sol 打破了 2018 年 Ford–Green–Konyagin–Maynard–Tao 五人合作保持的纪录。
知乎答主 @蜜罐数学布道 留下一句传神的比喻:LLM 的成果「像抖音神曲,第一耳朵新鲜,越听越单调」,而 Scholze、Venkatesh 们的经典工作「像交响乐,越品越有味道」。
2026.09.04|孪生素数上界来到 186
就是文章开头那一幕。
开启孪生素数整条线的张益唐,见证了 AI 对数学猜想的每一次推进。
再回看他在知乎上说的这句话,几乎是预言:
「不要把前人的东西看成至高无上的……这个东西别人这么做的,我能不能换一种做法?」
AI 这一年做的,恰恰就是推翻前人的信念。
数学的进步,似乎正在被 AI 技术按下快进键。
这一年的成果,到底有多少能被时间留下?
狂欢之后,人们也开始思考:
AI 对数学的研究,可信吗?
质疑并非空穴来风。
S⁶ 的构造与已发表结论正面矛盾,至今无人定论;大素数间隙的新纪录,Lean 只形式化了陈述、还没形式化证明,也还没有人独立消化;像森多夫那样「两套独立 Lean + 菲尔兹奖得主亲自消化」的完整闭环,反而是极少数。
更有人说,AI 目前摘下的,多是「低垂的果实」——是那些思路已经就位、只差搜索和计算的果实。
所以,我们现在也许无需恐慌「AI 会不会取代数学家」,更应该追问一句本质意义:
如果答案可以被批量生产,数学研究究竟还要追求什么?
🔥热门文章
🔥热门文章
🔥热门文章
本文内容来自「知乎」
点击上方卡片关注