OpenAI发布722份数学手稿引发验证与可信度的全面反思
TECH

OpenAI发布722份数学手稿引发验证与可信度的全面反思

61+
Signals

战略概览

  • 01.
    2026年10月6日,OpenAI向一个公开的GitHub仓库推送了722份数学手稿,这些手稿被组织为372个相互关联的结果家族,署名为一款尚未发布的内部前沿模型。主要声明包括一项“准黎曼假设”(zeta函数零点在实部7/8处有界)、唯一博弈猜想的证明、CM阿贝尔簇上的霍奇猜想的证明,以及自由群因子问题的解决。
  • 02.
    验证覆盖范围有限:372个结果家族中仅约235个(约63%)附带Lean形式化证明范围页面,而OpenAI自己的清单将该集合的状态描述为“部分进展”,并标注“未经审查状态”。没有任何一份手稿经过传统的同行评审。
  • 03.
    OpenAI披露,每项结果平均消耗约三小时的ChatGPT Pro“思考”计算资源,但未公布总成本、token数量、加速器使用时长、模型本身、权重或所用提示词——这使得独立数学家无法复现生成过程。
  • 04.
    此次发布发生于AI实验室与数学界关系本已紧张的背景下:25位菲尔兹奖得主签署联名信,警告AI公司与数学家的目标“严重错位”;作为回应,OpenAI成立了一个由九人组成的独立咨询小组(AGMAI);至少有一组MIT研究人员在9月仓促发布相关证明,以免被“抢发”。

深度分析

验证鸿沟:722份手稿,仅有一个部分校验和

OpenAI发布中最引人注目的数字是722份手稿和372个结果家族,但对于任何试图评估这些主张的人来说,更关键的数字是63% [1]。这是带有Lean形式化的内容占比——一种机器可验证的证明骨架,旨在确认逻辑步骤无矛盾地编译。其余家族完全没有此类支撑结构,而OpenAI自己的清单将整个集合的状态标记为“部分进展”且“未经审查”,这一坦白令人震惊,尤其当该发布被包装为突破性成果时 [1]。

即使存在Lean形式化,它回答的问题也比大多数报道暗示的要窄。Lean检查只能确认给定前提能否通过有效逻辑步骤推导出结论;它无法判断前提是否正确设定、结果是否真正新颖,或是否实质解决了其所声称的开放问题 [2]。此外,OpenAI仅披露了部分计算信息——每项结果平均约三小时的ChatGPT Pro“思考”时间——却隐瞒了总成本、token数量、加速器使用时长、模型本身、其权重以及所用提示词 [1]。没有这些信息,独立数学家无法复现生成过程,只能审计其产出的静态文档。最终结果是一个表面详尽记录、但按公司自身说法仅部分验证的集合。

一个领域的发声:菲尔兹奖得主对阵万亿级AI实验室

这次发布并非发生在真空中。2026年9月11日,25位菲尔兹奖得主签署联名信,宣称AI公司与数学界的“目标严重错位”,警告存在对智力工作的‘普遍威胁’,并提出所谓‘严重的归属权与剽窃问题’,源于仓促且未署名的解决方案 [3]。签署者之一陶哲轩对此机制的危害尤为直言不讳:他警告称,驱动AI实验室的经济激励使数学易受古德哈特法则影响,即解决问题本身成为公司优化的目标指标,而非真正理解的代理 [4]。

OpenAI对此压力的回应是制度性的而非技术性的。2026年9月21日,该公司支持成立了数学与人工智能咨询小组(AGMAI),这是一个由九人组成的专家组——包括爱德华·威滕和蒂莫西·高尔斯等资深人物——设在高等研究院,明确独立于任何AI公司,负责就意义评估和负责任发布提供建议 [5]。陶哲轩在发布前持续公开参与,于9月30日发布了关于AGMAI一般建议及西蒙斯研究所关于AI对理论计算机科学近期影响报告的帖子 [6]。这一安排读起来像是一种对冲:一家大型AI实验室邀请最具公信力的批评者担任评审,同时继续以任何评审机构都无法合理验证的速度推出成果。

人类追赶机器的代价

或许此次发布节奏最尖锐的后果根本与OpenAI的输出无关——而是人类数学家因传闻而被迫采取的行动。9月,在传言OpenAI可能宣布AI生成的唯一博弈猜想证明后,麻省理工学院的多尔·明泽及其研究生费宇谋和王硕迅速推出了一篇95页的手稿,研究相关的4比1博弈变体,专门为了在被超越前确立优先权 [7]。

明泽本人对这种压力的描述直截了当:研究人员不再知道是否会“被这家万亿级公司抢先”;他认为更深层的损失是教学法层面的,而不仅仅是竞争性的——他说:“失败并了解为何失败具有巨大价值,而将发现外包给AI则完全剥夺了这一过程。” 理论计算机科学家瑞安·奥唐奈明确对比指出,他赞扬MIT团队“以传统方式解决问题,用自己的头脑,并亲手写下证明” [7]。综合来看,这些反应描绘了一个学科:其严谨原创工作的时限正被AI发布的可能性压缩——无论这些AI主张最终是否成立。

庆祝与怀疑并存:究竟在宣称什么

OpenAI对自己发布的表述毫无保留地充满胜利色彩。CEO萨姆·阿尔特曼形容自己“今晚仰望星空时格外敬畏”,将这722份手稿视为人类与AI协作的里程碑,并感谢了该模型及历代数学家 [8]。推动这一叙事的具体主张在纸面上确实惊人:一项将zeta函数零点限制在实部7/8的“准黎曼假设”、唯一博弈猜想的证明、CM阿贝尔簇上霍奇猜想的证明,以及长期存在的自由群因子问题的解决,这些内容分布在372个家族中,以开放的Apache-2.0许可证发布于GitHub [9]。

但专家反应几乎立即分裂,分歧与数学本身无关,而关乎认识论。安德鲁·萨瑟兰认为,单次代理、一次性主张应被视为未经验证,“除非他们发布模型并允许他人复现结果”——用他的话说,“我们应该索要凭证” [4]。丹尼尔·利特则持相反立场,认为即使验证不完善,公开分享答案也优于公司将答案秘而不宣 [4]。两种观点都不否认手稿的存在或某些内容已通过Lean检查;分歧完全在于:来自封闭模型、未经审查且不可复现的主张应获得何种程度的信任——而在这一点上,数学界显然意见不一。

历史背景

明泽收到消息,暗示OpenAI即将宣布AI生成的唯一博弈猜想证明。
签署公开信,警告AI公司与数学界之间的激励机制错位。
仓促发布一篇关于Khot的2比1猜想的4比1博弈变体的95页手稿,以避免被OpenAI overshadow。
AGMAI的成立通过陶哲轩博客的客座文章宣布,建立一个设在高等研究院的九人独立咨询机构。
陶哲轩发布了两份新报告的链接:AGMAI的一般建议和西蒙斯研究所关于AI与理论计算机科学的工作组报告。
在GitHub上以Apache-2.0许可证发布了涵盖372个结果家族的722份手稿,包括唯一博弈猜想证明及其他三项重磅声明。

关键关系图

关键玩家
主题

OpenAI发布722份数学手稿引发验证与可信度的全面反思

OP

OpenAI

通过GitHub以Apache-2.0许可证发布722份手稿,归功于一款未命名、未发布的内部模型;披露了部分计算数据,但未提供模型、权重或提示词。

SA

Sam Altman

OpenAI首席执行官;公开以情感化言辞庆祝发布,感谢‘机器们’及历代数学家。

TE

Terence Tao (UCLA, Fields Medalist)

主要批评声音之一;签署了25位菲尔兹奖得主的公开信,警告AI驱动数学中的古德哈特法则现象,并在其博客上宣布了AGMAI咨询小组。

AD

Advisory Group on Mathematics and Artificial Intelligence (AGMAI)

设在高等研究院的九人独立专家组,成立目的是就AI生成数学的意义评估与负责任发布向OpenAI提供建议。

DO

Dor Minzer, Yumou Fei, Shuo Wang (MIT)

在2026年9月14日仓促发表关于4比1博弈变体的相关成果,因听闻OpenAI可能宣布AI生成的唯一博弈猜想证明,以避免被抢先。

25

25 Fields Medalists (joint letter)

宣称AI公司与数学家的目标‘严重错位’,并警告‘智力工作面临普遍威胁’,提及归属权与剽窃问题。

事实来源

9 条引用
  1. [1] OpenAI's 722 Math Manuscripts: The Results, Proofs, Compute and Costs
  2. [2] OpenAI Drops 722 AI Math Manuscripts On GitHub, Experts Must Now Verify Them
  3. [3] The warning of 25 Fields medals: the objectives of the companies of AI and those of the mathematical community diverge profoundly
  4. [4] OpenAI Unleashes Hundreds More Math Results Upon a Field Already in Shock
  5. [5] OpenAI Forms AGMAI Advisory Group With Nine Mathematicians to Guide AI Math Research
  6. [6] Two reports
  7. [7] As AI Closed In on 'Unique Games' Proof, Researchers Raced to Beat the Machines
  8. [8] 'Looking Up At Stars With Extra Awe Tonight': Sam Altman After OpenAI Publishes 300+ Math Proofs Including Quasi-Riemann Hypothesis
  9. [9] OpenAI Releases 722 AI-Generated Math Manuscripts Tackling Long-Standing Problems

来源文章

Top 5

THE SIGNAL.

Analysts

“认为一次性AI主张在模型发布且结果能被他人复现之前,应被视为未经验证。”

Andrew Sutherland
MIT mathematician, skeptical, demands independent reproduction

“相信如果公司分享开放问题的答案,对领域而言比保密更好。”

Daniel Litt
University of Toronto mathematician, cautiously positive on transparency

“描述了与AI实验室竞相发表的压力,并认为将证明发现外包给AI会剥夺从失败中学习的价值。”

Dor Minzer
MIT professor, concerned about process and incentive distortion

“对比了MIT团队有机推导出的结果与OpenAI的AI起草的同一类问题的证明。”

Ryan O'Donnell
Theoretical computer scientist, values the human-derived result over the AI-generated one

“警告将开放问题求解作为能力展示会威胁归属规范、智力工作以及未解决问题的教学作用。”

25 Fields Medalists (joint letter)
Alarmed; calls the goals of AI labs and mathematicians incompatible
The Crowd

“🚨 ITS HERE ! Openai M A T H - 772 manuscripts organised into 372 families “ The Quasi-Riemann Hypothesis “ https://t.co/8MEcE9af9A”

@@apples_jimmy447

“I asked Claude Fable 5.5 to explain OpenAI's new 199-page quasi hiemann hypothesis proof. It came back with a 2-minute 3D animation. The claim: NO zeros of zeta past 7/8. First fixed zero-free strip EVER. Not the Riemann hypothesis, but if it holds, the closest anyone has come. https://t.co/s0t8FMWfhR”

@@imjustnewatai474

“OpenAI is close to solving the Hodge Conjecture, another of the seven Millennium Prize Problems, according to a person with knowledge of the work. Read more: https://t.co/Km9sK0sMEy”

@@theinformation227

“OpenAI drops 722 math papers written by internal reasoning model”

@u/kzhou71258
Broadcast
OpenAI claims it solved decades-old math problem

OpenAI claims it solved decades-old math problem

OpenAI's Math "Breakthrough" Is Falling Apart?

OpenAI's Math "Breakthrough" Is Falling Apart?

OpenAI's secret model just BROKE math...

OpenAI's secret model just BROKE math...