标题数字背后的验证鸿沟
2026年10月6日,OpenAI发布由其未公开的前沿内部模型生成的722份数学手稿,整理为372个结果家族,并以Apache-2.0许可证发布至公共GitHub仓库[1]。该模型共尝试解决约4000个开放性问题,每个已发布结果平均消耗相当于ChatGPT Pro级别约三小时的计算资源[1]。其中引人注目的声明包括:部分‘准黎曼假设’结果、与唯一游戏猜想相关的Lean形式化验证证明,以及CM阿贝尔簇的霍奇猜想解决[2]。
但比722更重要的数字是42%——这是已发布证明中实际通过Lean形式化验证的比例,而该自动化证明检查标准正日益被视为数学界信任的基准[3]。在最终719份手稿中,仅有10份附带了展示模型推理过程的链式思维摘要[3]。这一差距并非理论问题:发布后一天,OpenAI因发现一个符号错误而撤回三份与霍奇猜想相关的手稿,该错误使另外两篇被撤回论文所依赖的论证失效,并单独修订14篇论文,更新13条引用[4]。这种‘先大规模发布,后发现错误’的模式,正是形式化验证本应防止的失败模式,而它本应在发布前而非发布后被捕捉。



