OpenAI的Astra模型解决了10个开放数学问题
TECH

OpenAI的Astra模型解决了10个开放数学问题

37+
Signals

战略概览

  • 01.
    OpenAI下一代主要模型系列Astra的一个内部未发布版本,在数学和理论计算机科学领域取得了新成果,解决了至少十年来悬而未决的10个问题,并发表在一份249页的手稿中。
  • 02.
    最引人注目的成果包括首次明确构造出一个非sofic群(自1999年以来一直未解的问题)以及对Alain Connes在1980年提出的刚性猜想的反证;其他成果还包括改进的球体堆积上界、Erdos目录中的问题,以及与格密码学相关的难度结果。
  • 03.
    OpenAI表示,全部10个解决方案的总计算成本约为2,000美元,且每个证明都已形式化为Lean 4证书,其“sorry”计数为零,意味着没有一步证明未经验证。
  • 04.
    山姆·阿尔特曼于7月29日在华盛顿特区向美国参议员拉斐尔·沃诺克和伯尼·莫雷诺展示了Astra,此举发生在该模型预计将经历的政府预发布审查流程之前。

深度分析

十个问题,一条共同线索

Astra最突出的成果是首次明确构造出一个非sofic群,终结了数学家米哈伊尔·格罗莫夫于1999年提出的问题 [2]。它还推翻了菲尔兹奖得主Alain Connes在1980年提出的刚性猜想。此外还有八项进展:自1978年以来首次改进高维球体堆积密度的一般上界、来自Erdos目录的三个问题、一个量子并行重复定理、新的电路复杂性下界,以及对最近向量问题的难度结果,这对基于格的密码学具有重要意义 [3]。OpenAI表示,这个内部未发布的模型以大约2,000美元的计算成本产出了这十项成果 [1]

机器可验证,但无法独立复现

每份证明都附带一个‘sorry’计数为零的Lean 4证书,意味着这十个证明中的任何一步都没有被验证器遗漏 [4]。但实现这一完美记录的工作流程并不仅仅是模型单独运行的结果:Astra生成了数学论证,人类数学家将其精炼成论文,然后模型再将这些论证转化为Lean证书 [1]。由于Astra本身尚未发布,外部研究人员可以逐行审计这些证书,但他们无法重新运行模型、检查其提示词,或了解在这十个成功案例背后有多少次失败尝试。这种信息缺失催生了一种在网络上流传的竞争性观点:这十项成果背后的真正过程可能更像是一支专家团队在数月内持续访问系统后取得的成果,而非一个自主模型在无人监督下完成任务——实际上是人机协同,而非机器取代人类。这也呼应了OpenAI自身历史上的某种模式:早前一项声称解决开放问题的说法曾遭到竞争对手实验室人士的公开批评,而此次数学界则更多地通过核查实际证书作出更为审慎的回应。

Anthropic的24小时快速检验

独家性的说法在遭遇竞争对手实验室时未能站稳脚跟。任职于Anthropic的哈佛大学数学家Levent Alpoge使用公开可用的Claude Fable模型、通用提示词且无网络接入的情况下,在24小时内复现了十项成果中的五项 [5]。这一重叠并未抹杀Astra的成就,但它削弱了只有OpenAI未发布系统才能达到此类成果的观点,并强化了外界批评中提出的一个问题:在OpenAI选择发布的这十个问题背后,究竟有多少次失败尝试。

一场在华盛顿的演示,而不仅是一篇数学论文

这些数学成果公布的几天前,山姆·阿尔特曼已在华盛顿特区向美国参议员展示了Astra [7],此举发生在Astra预计将作为首个OpenAI模型接受政府预发布审查之前 [8]。像AI研究者加里·马库斯这样的批评者认为,这项成就是真实的,但被“严重夸大”:数学是一个对AI系统异常有利的领域,因为它自带自动验证工具(Lean)和丰富的合成训练数据,而大多数现实世界的科学和商业问题并不具备这些条件,因此干净利落地完成十项形式化证明,并不一定预示着在更混乱、不可验证的任务上也能成功 [6]

历史背景

在Astra取得成果之前,高维球体堆积密度的一般上界自1978年以来从未被改进过。
菲尔兹奖得主Alain Connes提出了关于冯·诺依曼代数的刚性猜想,Astra通过构造无限多个共享相同代数的非同构性质(T)群将其推翻。
格罗莫夫引入了soficity的概念,留下了一个问题:是否每一个可数离散群都是sofic——Astra通过构造首个已知的非sofic群解决了这个问题。
Kevin Weil早前声称GPT-5解决了Erdos问题,却被目录维护者Thomas Bloom批评为‘严重误传’,这为当前对Astra新主张的怀疑提供了背景。
阿尔特曼在华盛顿特区会见了参议员Raphael Warnock和Bernie Moreno,提前展示了Astra,为其即将进行的政府预发布审查做准备。
OpenAI通过发布详细描述10个已解决开放数学问题的249页报告,公开披露了Astra模型系列。

关键关系图

关键玩家
主题

OpenAI的Astra模型解决了10个开放数学问题

OP

OpenAI

开发了Astra,控制对该未发布模型的所有访问权限,发布了249页报告和Lean证书,并正在引导披露进程,以迎接计划中的政府预发布审查。

AN

Anthropic (Levent Alpoge)

在24小时内使用公开可用的Claude Fable模型复现了10项成果中的5项,直接测试并削弱了OpenAI的排他性主张。

TH

Thomas Bloom

Erdos问题目录的维护者;他对哪些问题才算真正解决的判断在数学界具有权威性,且他曾将OpenAI早前的一项数学主张称为‘严重误传’。

US

US policymakers (Senators Warnock, Moreno, Warner)

正由阿尔特曼直接简报Astra的情况,处于决定该模型是否以及如何向公众发布的关键位置,尤其是在其计划中的政府预发布审查背景下。

事实来源

8 条引用
  1. [1] OpenAI's Astra Solves 10 Long-Open Math Problems, Publishes Proofs
  2. [2] OpenAI's Astra Model Produces Ten Math Proofs, Including Non-Sofic Groups
  3. [3] OpenAI Announces Its Next Major Model Astra by Dropping Ten Previously Unsolved Math Solutions
  4. [4] OpenAI's Unreleased Model Astra Solves 10 Open Math Problems
  5. [5] OpenAI Claims Its Astra Model Solved 10 Difficult Math Problems; Anthropic Says Fable Solved 5
  6. [6] OpenAI's Amazing But Vastly Oversold
  7. [7] Exclusive: OpenAI Previews 'Astra' AI Model in DC
  8. [8] OpenAI Is Reportedly Building Astra, a Model Family Designed to Work on Problems for Hours or Days

来源文章

Top 5

THE SIGNAL.

Analysts

称这项成就是真实的,但被‘严重夸大’:OpenAI未披露Astra在最终选定10个成功案例之前尝试了多少猜想;数学因其拥有自动验证工具(Lean)和合成训练数据而成为一个异常有利的领域,这与大多数现实世界的科学问题不同;而长达249页的报告并未透露模型实际工作原理的任何信息。

Gary Marcus
AI批评者,Substack作者

在不到24小时内使用公开可用的Claude Fable模型和通用提示词且无网络访问的情况下,复现了Astra十项成果中的五项,表明OpenAI所暗示的前沿能力差距可能比其所呈现的小得多。

Levent Alpoge
数学家,Anthropic

表达了对AI解决他自己多年研究的开放问题时既感到敬畏又不安的情绪,反映了科研数学家中普遍存在的矛盾反应。

Henry Yuen
数学家

据报道他表示,他会毫不犹豫地推荐将该证明发表于顶级数学期刊——这一背书直接挑战了本文关于验证局限性的整体叙述框架。

Tim Gowers
菲尔兹奖得主,数学家

将这十项成果视为AI科学推理能力进步的证据。

Noam Brown
研究科学家,OpenAI
The Crowd

An internal version of Astra, @OpenAI's next major model family, solved 10 major open problems in mathematics, quantum complexity, and theoretical computer science. We believe it will be a major step for scientific reasoning. openai.com/index/ten-adva

@@polynoamial17466

OpenAI just spent $2,000 to solve 10 problems that have beaten the world's best mathematicians for DECADES. Nobody outside the company is allowed to run the machine that did it. On Saturday OpenAI published a 249-page report and gave its next model family a name: Astra. An [video attached]

@@Ric_RTP311

🚨 BREAKING, Hysterical News: Half of the Astra problems can be solved Fable. OpenAI didn't even have a control group. And most of you fell for it! OpenAI's PR department suckered you AGAIN 🤣🤣🤣 [GIF attached]

@@GaryMarcus101

OpenAI: Ten advances in mathematics and theoretical computer science

@u/Salt_Attorney887
Broadcast
OpenAI's Astra JUST solved math...

OpenAI's Astra JUST solved math...

OpenAI just SOLVED MATH....

OpenAI just SOLVED MATH....

OpenAI's Hidden Model Astra Just Broke Mathematics

OpenAI's Hidden Model Astra Just Broke Mathematics