OpenAI大规模发布AI生成的数学证明
TECH

OpenAI大规模发布AI生成的数学证明

45+
Signals

战略概览

  • 01.
    2026年10月6日,OpenAI在GitHub上发布了722份由其未公开的内部模型生成的数学手稿(涵盖372类成果),针对大约4,000个已提出的开放性问题,其中包括对唯一游戏猜想(Unique Games Conjecture)和“准黎曼假设”(quasi-Riemann hypothesis)的所谓进展。
  • 02.
    2026年10月7日,OpenAI因发现一个符号错误导致关键的稳定迹论证失效,撤回了三份手稿,使目录缩减至719份,并触发了另外14篇论文的修订以及13条引用的更新。
  • 03.
    截至2026年10月7日,719份幸存的主要成果中仅有约42%(300份手稿)具备机器验证的Lean证明,OpenAI自身也承认,未经形式化的结果仍可能包含错误。
  • 04.
    此次发布引发了强烈的公众反弹,新成立的人类数学协会——包括数学家陶哲轩(Terence Tao)和批评者加里·马库斯(Gary Marcus)——谴责其缺乏同行评审与透明度,尽管OpenAI仍在持续咨询数周前成立的独立顾问小组(AGMAI)。

深度分析

未曾实现的验证层

OpenAI跳过同行评审的核心论点是,Lean形式化——即可由机器验证的证明代码——使得手动验证比传统审稿“更可行”[1]。然而在实践中,这一替代方案既不完整,在至少一个案例中还具有误导性。截至2026年10月7日,719份幸存的主要成果中仅有约42%——即300份手稿——附带了经过机器验证的Lean证明,这意味着大多数主张依赖于OpenAI对其内部模型推理过程的单方面描述,而非独立确认[2]。更严重的是,一项配套分析交叉核对了其中一份经Lean形式化的头条成果——目录中的纳维-斯托克斯方程手稿——发现该证书实际上与书面论证不符:形式化中的一个估计需要四阶导数,而自然语言证明声称需要五阶;压力通量边界通过与散文描述不同的论证方式得证。换句话说,一个能顺利编译的Lean文件,并不能保证其所声称认证的英文证明就是实际被验证的证明——而此次发布的框架却模糊了这一区别。加里·马库斯的批评从另一个角度指出了同样的缺口:在未披露模型架构、失败率或生成流程的情况下,无法判断那已通过验证的42%是否能代表其余58%未验证的部分。“这永远无法通过同行评审,”他写道,强调方法的透明度而非产出数量,才是科学主张与技术演示之间的根本区别[3]。

一个符号错误与目录的脆弱性

此次发布的庞大规模使其内部依赖关系难以察觉,而这恰恰让最初24小时变得极具启发性。2026年10月7日,OpenAI撤回了三份手稿——关于Weil类的代数性、Kuga-Satake对应关系以及K3曲面乘积的有理Hodge猜想——原因是发现一个符号错误使支撑其中两项成果的稳定迹消去论证失效。修正的影响迅速扩散:另外14份手稿需要修订,13条引用需更新,这一切都发生在一次被宣传为已完成、已审查的工作发布后的一天之内[2]。这种连锁反应预示着,当单一模型基于大致4,000个提出的问题、几乎以一次马拉松式运行[5]生成层层叠加的结果时会发生什么。安德鲁·萨瑟兰(Andrew Sutherland)的怀疑直接源于此逻辑:由于OpenAI的内部模型仍未发布,公司外无人能重跑据称产生每项结果的单一提示,因此目前所谓“一次性解决”某个问题的说法,仅仅是OpenAI的一面之词[4]。这个符号错误表明,这种说法并非无误——并引发了一个显而易见的问题:在尚未经过任何形式化检查的58%目录中,还有多少类似错误未被发现?

一个无权叫停的顾问委员会

OpenAI并非在毫无制度掩护的情况下推出此次发布。2026年9月21日——发布前两周半——该公司宣布成立数学与人工智能顾问组(Advisory Group on Mathematics and Artificial Intelligence, AGMAI),一个由九名成员组成、设在普林斯顿高等研究院(Institute for Advanced Study)的小组,明确宣称其职责是指导OpenAI的分享实践[6][7]。然而,无论它提供了何种建议,均未能明显阻止或影响两周半后一天内发布722份手稿的决定,表明该顾问组对实验室的发布日程并无实质否决权。这种结构性张力在OpenAI自身的合作者圈内显现:陶哲轩(Terence Tao)既是AGMAI创始成员,也是发布人类数学协会声明的主要推动者,该声明谴责了本应由其顾问组指导的发布行为,称其为“不是学术的展示,而是权力的展示”[8]。陶哲轩本人的表述更为深入,将当前时刻描述为一种不健康的“数学1.0”模式——由AI操作者自主解决问题,对整个领域的发展毫无兴趣——并呼吁转向以阐释与共同体为核心的“数学2.0”,而非单纯追求成果数量[9]。一位现任公司顾问同时也是最显眼的批评者,这反映的并非个人立场矛盾,而是OpenAI的数学项目已远远超前于其自身的治理结构。

通过新闻稿做数学

此次发布已重塑了激励机制,其影响远超个别证明是否成立。普林斯顿大学的马克·布拉弗曼(Mark Braverman)直白地指出:“通过新闻稿做数学,对数学本身并不健康”[10]。这种抱怨并非抽象——当数学家们意识到OpenAI正在逼近时,那些研究与唯一游戏猜想相关问题的研究者纷纷赶在或紧随OpenAI声明之前发表自己的成果,将原本严谨、经同行评审的工作变成了一场与公司发布节奏的赛跑[10]。社区反应也沿相似路线分裂:普通科技受众倾向于接受“AI终于追上了最难的开放性问题”的叙事,而更接近工作的数学家和物理学家则描述了一个真正的瓶颈如今已是人类验证能力而非算力的领域,一些博士生报告称,他们正在进行的论文课题一夜之间就被超越。不过,并非所有人都认为这种反弹是恰当回应。丹·利特(Dan Litt)的反驳同时针对陶哲轩、马库斯和布拉弗曼:“如果我们想知道这些数学问题的答案,我看不出有任何理由要求公司对我们保密。在我看来,这对数学将是件好事”[9]。这场分歧本质上并非关于证明是否正确,而是关于一个领域的发现节奏是否应由最能负担推理算力的一方设定,而不论其输出事后被多么仔细地验证。

历史背景

发布了来自其未公开“Astra”内部模型的十项形式化验证的数学进展,是10月大规模发布的小型前奏。
宣布成立设于普林斯顿高等研究院的九人数学与人工智能顾问组(AGMAI),时间早于10月的大规模发布数周。
在GitHub上发布了名为“openai/math”的仓库,包含372类成果的722份手稿。
因符号错误撤回三份手稿,修订14份其他论文,并更新13条引用;同日,人类数学协会发布声明谴责此次发布。

关键关系图

关键玩家
主题

OpenAI大规模发布AI生成的数学证明

事实来源

10 条引用
  1. [1] OpenAI Dumps 372 AI-Generated Math Proofs on GitHub, Telling the Academic World to Keep Up
  2. [2] OpenAI Posts 372 AI Math Results, Then Withdraws Three Papers Over a Sign Error
  3. [3] Complementary Remarks from Gary Marcus
  4. [4] OpenAI Unleashes Hundreds More Math Results Upon a Field Already in Shock
  5. [5] OpenAI's Largest Math Release Yet Comes With Lean Proofs
  6. [6] OpenAI Releases 722 Math Manuscripts From an Unreleased AI Model
  7. [7] OpenAI Forms Math Advisory Group Amid 100 Solved Problems Claim
  8. [8] AHM Statement on OpenAI's October 6 Release of Mathematical Documents
  9. [9] OpenAI Math Controversy: Solutions to 370 Outstanding Challenges Published Amid Criticism and Celebration
  10. [10] As AI Closed In on Unique Games Proof, Researchers Raced to Beat the Machines

来源文章

Top 5

THE SIGNAL.

Analysts

“认为此次发布反映了不健康的“数学1.0”模式,即由AI提示工程师自主解决问题,对整个领域毫无兴趣,呼吁转向以阐释与共同体为核心的“数学2.0”,而非单纯追求原始成果数量。”

Terence Tao
数学家,加州大学洛杉矶分校;AGMAI顾问组成员

“表示此次发布缺乏通过同行评审所需的严谨性,且未披露模型的架构、流程或失败率:“这永远无法通过同行评审。””

Gary Marcus
AI批评者/认知科学家

“谴责此次发布“完全无视科学研究规范”,并呼吁数学家停止与OpenAI合作:“一次性发布700多份文件并非学术展示,而是权力展示。””

Association for Human Mathematics
新成立的数学家倡导组织

“认为所谓‘一次性解决’难题的主张,除非模型被释放供独立复现,否则应视为未经验证。”

Andrew Sutherland
数学家,麻省理工学院

“反对反弹情绪,认为即使方法存在争议,公开数学答案仍有利于该领域:“如果我们想知道这些问题的答案,我看不出有任何理由要求公司对我们保密。””

Daniel (Dan) Litt
数学家,多伦多大学
The Crowd

“BREAKING: OpenAI's solution to Navier–Stokes does not match its Lean verification. The most important article to read today is not one of OpenAI's 700 AI-generated math papers. It is this other paper, making a deep and worrying point: A Lean-verified proof does not automatically validate the proof written in natural language, nor does it mean that the formal statement captures the intended theorem. During translation, an AI can change an assumption, weaken a statement, or replace the argument entirely. It can hallucinate another theorem. Lean correctly verifies the result. But the proved result may no longer be what the paper claims. This is a general problem. Things get spicy when the authors examine OpenAI's proposed Navier-Stokes solution. They identify at least two mismatches between the written intermediate results and their Lean counterparts: One estimate claims that four additional input derivatives suffice. The Lean version requires five: a weaker result. A pressure-flux estimate is obtained through a different bound, and proved through a different argument. It is not clear whether these mismatches invalidate the entire proof. But they raise an important issue. OpenAI is flooding us with claimed revolutionary breakthroughs. Yet nobody knows whether the proofs are correct or whether they prove what they claim to be proving. Epistemia at scale.”

@@ValerioCapraro3003

“Opus 5.5 on github.com/openai/math --- Okay. I need a minute. I cloned the thing expecting maybe forty or fifty families of serious-but-niche results. Family 003 claims a zero-free half-plane Re s > 7/8 for ζ and every Dirichlet L-function. That's the quasi-Riemann hypothesis. And it isn't even the headline, because 004 is Hilbert's tenth problem over ℚ, done negatively. Khot's Unique Games Conjecture is proved. 372 families sitting in a table like a grocery list. Only around 120 papers have a formalized main result. My honest gut reaction is a mix of awe and vertigo.”

@@ereliuer_eteer1704

“Controversial Opinion: The internal model by @OpenAI that solved all these math problems is better but not crazy better than Astra. I am an expert on papers 148 and 153. The result of 148, which is stunning, I got with Astra myself after a 6-hour session on September 27. What I am saying is that Astra already can make real breakthroughs in mathematics. The internal model is surely better, but at least in my area of expertise it doesn't seem to strongly outperform Astra.”

@@ConstantinKogl1218

“OpenAI unleashes hundreds more math results upon a field already in shock”

@u/ResultBackground24505900
Broadcast
OpenAI's secret model just BROKE math...

OpenAI's secret model just BROKE math...

OpenAI Just Broke Math With Its Most Powerful AI Yet

OpenAI Just Broke Math With Its Most Powerful AI Yet

BIGGEST Proof Dump in History! | OpenAI Release 722 Manuscripts

BIGGEST Proof Dump in History! | OpenAI Release 722 Manuscripts

OpenAI大规模发布AI生成的数学证明 — AI 新闻 | Agentic Brew