OpenAI的Astra模型解决了十大著名未解数学难题
TECH

OpenAI的Astra模型解决了十大著名未解数学难题

27+
Signals

战略概览

  • 01.
    OpenAI宣布,其下一代主要模型家族Astra的一个内部未发布版本,在数学和理论计算机科学领域的十个开放性问题上取得了新成果,这些问题均至少十年未被解决。
  • 02.
    2026年8月1日,OpenAI发布了一份249页的技术手稿和一份62页的推理过程说明,并附上了全部十项成果的机器可验证Lean 4证书。
  • 03.
    最引人注目的成果是首次明确构造出一个非sofic群,这一问题自1999年米哈伊尔·格罗莫夫(Mikhail Gromov)提出soficity概念以来一直悬而未决;据称Astra还推翻了Connes的刚性猜想。
  • 04.
    OpenAI表示,生成全部十项解决方案的总token成本在其内部'Sol' API费率下约为2000美元。

深度分析

验证的技巧:为何人们信任Astra的证明

OpenAI并没有要求人们盲目相信Astra的说法。这十个证明中的每一个都被形式化为Lean 4,生成了一个机器可验证的证书,其正确性可以由编译器验证,而完全无需信任模型自身的自然语言推理[1]。这才是公告背后的真正新闻:数学与形式逻辑是少数几个AI系统的输出可以由软件而非专家委员会来评判的领域,这正是OpenAI选择这一领域来预览其未发布模型家族Astra的原因——无需发布产品,仅通过一份249页的技术手稿和一份62页的推理说明,于2026年8月1日公开发布[2]

最引人注目的成果是首次明确构造出一个非sofic群,解决了数学家米哈伊尔·格罗莫夫(Mikhail Gromov)1999年提出soficity概念后遗留的问题——该问题悬而未决长达27年[3]。此外,Astra据称通过构建无限多个具有性质(T)但共享相同冯·诺依曼代数的非同构群,推翻了Connes的刚性猜想;还在最短向量问题上取得了难度结果,直接影响基于格的密码学——这是大多数后量子加密方案所依赖的数学基础[4]。它还实现了自1978年以来高维球体堆积密度通用上界的首次改进,达到了数十年前科恩(Cohn)和埃尔基斯(Elkies)设定的阈值[5]。这些不是基准测试分数——而是任何在职数学家一眼就能认出的、已解决的著名问题。

人人都在争论的2000美元数字

OpenAI表示,生成全部十项解决方案的总token成本在其内部'Sol' API费率下约为2000美元[6]。这个数字令人震惊,也是公告中最具争议的部分。评论者指出,token成本仅计算了成功的运行——并未计入所有失败尝试的成本,也未计入人类选择将Astra指向哪些问题或整理生成证书所花费的时间——因此这更接近于“发表成本”而非真正的“发现成本”[7]

这一成就的独特性也受到了直接挑战。竞争对手实验室Anthropic的数学家Levent Alpöge表示,一个公开的Claude模型仅使用通用提示、无网络访问且完全自主的情况下,在24小时内复现了Astra大约一半的结果[7]。如果这一说法成立,它将重塑整个叙事:不再是“一个闭源模型实现了其他系统无法做到的事”,而是“一个模型取得了成果,而竞争对手的公开模型在得知方向后几乎立即复现了大部分成果”。这一公告还出现在OpenAI和Google DeepMind均声称在2025年国际数学奥林匹克竞赛中达到金牌水平的一年之后[8]——Astra的成果更像是一场前沿实验室之间持续竞争信号战的下一个节拍,而非突如其来的突破,其时机恰好用于在尚未发布或定价模型家族的情况下进行预览。

真实进展还是仅是反例?关于实质性的争论

至少部分工作的外部验证是真实的。菲尔兹奖得主蒂姆·高尔斯(Tim Gowers)审阅了其中一项证明,并表示他会毫不犹豫地推荐其发表于顶级数学期刊[9]。负责维护保罗·埃尔德什(Paul Erdős)遗留开放问题目录的托马斯·布鲁姆(Thomas Bloom)称这些成果为“重大新闻”,并认为其重要性超过OpenAI此前更窄范围的数学成果——值得注意的是,Astra解决的十个问题中有三个直接来自埃尔德什的列表[9]

但最严厉的批评质疑这究竟是一种什么样的成就。AI研究者加里·马库斯(Gary Marcus)称这一公告“令人惊叹但被严重夸大”,指出249页的手稿和推理说明均未披露任何关于成果是如何产生的信息,并警告不要陷入所谓的“合成谬误”——即假设在形式数学等狭窄、可验证领域中的成功,意味着更广泛的通用能力[7]。这种怀疑呼应了数学界反应中可见的技术分歧:许多讨论集中在Astra是否主要找到了推翻现有猜想的反例,而非构建真正新的概念框架;一些读者还批评推理说明文件本身难以理解。这两种批评都指向同一个空白:验证(证明能否编译通过)与理解(是否有人——人类或机器——学到了关于其为何成立的新知识)是两个不同的问题。

数学家并非都在欢呼

并非所有反应都是惊叹。据报道,数学家们发布了被称为“莱顿宣言”(Leiden Declaration)的声明,获得国际数学联盟(International Mathematical Union)支持,警告AI公司正在未经同意的情况下使用已发表的数学研究成果,并通过新闻稿而非期刊投稿的方式宣布成果,绕过了同行评审[3]。这是一种结构性的批评,而非技术性批评:反对的不是证明错误,而是该领域的公共产出正被用作训练和评估材料而未经该领域同意,且“代理评审”(agent-reviewed)正在公共传播中被允许替代同行评审。

反应中还有一股更个人化的情绪——不安,而不仅仅是专业批评。软件工程师费尔南多·博雷蒂(Fernando Borretti)尖锐地捕捉到了这一点:‘我们将生活在一个被恶魔缠绕的世界,充满奇妙的设备,但我们无法理解它们的运作方式’[4]。在机构性反对之下,还潜藏着一种更安静的焦虑:像Astra这样的系统若无法平等获取,将如何影响谁能够做出下一个重大发现——以及当做出发现的模型本身不对所有人开放时,率先解决难题是否还具有同样的意义。

历史背景

在群论中引入了soficity的概念,提出了是否存在非sofic群的问题——这一问题在27年后由Astra的构造得以解决。
高维球体堆积密度的通用上界自该年以来一直未被改进,直到Astra取得新成果。
两家公司的AI模型均在国际数学奥林匹克竞赛中达到金牌水平,为一年后Astra的数学公告奠定了背景。
发布了249页的手稿、62页的推理说明以及Lean 4证书,披露了Astra的十项数学成果。

关键关系图

关键玩家
主题

OpenAI的Astra模型解决了十大著名未解数学难题

OP

OpenAI

Astra的开发者;发布了成果、249页手稿、62页推理说明以及Lean证书,在Apache 2.0许可下公开,作为其下一代主要模型家族的隐式预览,而未发布完整产品。

AN

Anthropic (via mathematician Levent Alpöge)

竞争对手实验室;Alpöge表示,一个公开的Claude模型仅使用通用提示、无网络访问且完全自主的情况下,在24小时内复现了Astra约一半的成果——直接挑战了OpenAI成就的独特性。

TI

Tim Gowers (Fields Medalist)

独立评审者,其背书提供了外部可信度;表示他会毫不犹豫地推荐至少一项证明发表于顶级数学期刊。

TH

Thomas Bloom (maintainer, Erdős Problems database)

评估了埃尔德什目录成果的意义,称其为‘重大新闻’,并认为其重要性超过OpenAI此前的数学成果。

GA

Gary Marcus (AI critic)

公开批评该公告为‘令人惊叹但被严重夸大’,指出OpenAI未披露方法论,并警告在狭窄、可验证数学领域的成功无法推广到更广泛的通用能力主张。

IN

International Mathematical Union / signatories of the 'Leiden Declaration'

被引用的数学界机构,警告AI公司正在未经同意的情况下使用已发表的数学研究成果,并通过新闻稿而非同行评审宣布成果。

事实来源

9 条引用
  1. [1] OpenAI Announces Its Next Major Model Astra by Dropping Ten Previously Unsolved Math Solutions
  2. [2] OpenAI's Astra Solves Ten Decade-Old Math Problems With Machine-Checkable Lean Proofs
  3. [3] OpenAI's Astra Model Produces Ten Math Proofs, Including Non-Sofic Groups
  4. [4] OpenAI's Astra Solves 10 Long-Open Math Problems, Publishes Proofs
  5. [5] OpenAI's Astra Model Solves 10 Major Mathematic Problems
  6. [6] OpenAI's Unreleased Model Astra Solves Ten Open Math Problems
  7. [7] OpenAI's Amazing But Vastly Oversold
  8. [8] OpenAI Claims IMO Gold Medal
  9. [9] OpenAI's Astra Solved 10 Decades-Old Math Problems For Just $2,000

来源文章

Top 5

THE SIGNAL.

Analysts

认为公告令人印象深刻但被夸大:‘这些成果以及随附的249页数学论文均未提供任何关于如何实现的信息’,并警告不要假设狭窄的数学能力意味着更广泛的通用智能。

Gary Marcus
AI研究者与批评者

毫不犹豫地认可至少一项证明的数学质量,认为其有资格发表于顶级期刊。

Tim Gowers
菲尔兹奖得主

评价8月的成果比OpenAI此前的单位距离数学成果更具意义,称其为‘重大新闻’。

Thomas Bloom
埃尔德什问题数据库维护者

对由AI系统塑造的未来表示不安,这些系统的内部运作人类无法理解:‘我们将生活在一个被恶魔缠绕的世界,充满奇妙的设备,但我们无法理解它们的运作方式。’

Fernando Borretti
软件工程师

认为AI的优势集中在具有廉价、自动验证的领域,暗示这一成就无法推广到不可验证的领域:‘如果你处于一个可验证的领域,就转向一个不可验证的领域。’

Jon Stokes
评论员
The Crowd

An internal version of our next major model produced 10 new results on long-standing open problems in mathematics and theoretical computer science, using roughly $2,000 worth of tokens at GPT-5.6 Sol API rates.

@@OpenAI13490

Terence Tao got voluntold into running a workshop because he sounded too excited in a meeting. Four years later, OpenAI published ten proofs to the standard that room was built around. ... Saturday, OpenAI published ten results from an unreleased model called Astra. A construction proving non-sofic groups exist, open since 1999. The first improvement to the general sphere packing bound since 1978. A disproof of Connes's rigidity conjecture. Three Erdos problems. Hardness for the closest vector problem, the lattice question post-quantum cryptography sits on. Every one had gone at least a decade without progress. ... Every result shipped with a Lean certificate on GitHub. Not a claim. A file that compiles or doesn't, on any laptop, for anyone. ... OpenAI cited the [Leiden] declaration on Saturday and declined to claim human authorship for any of the ten proofs. In May the same lab disproved the Erdos unit distance conjecture. ... The cost of a new theorem just fell to a line on an invoice. The cost of noticing did not move.

@@r0ck3t2328

SITUATION EXPLAINED: OpenAI's unreleased Astra model solved ten open math problems for under $2,000 in compute. ... The headline result is the first explicit construction of a non-sofic group, a question open since Gromov introduced soficity in 1999. Astra also disproved Connes's rigidity conjecture and proved Ehrhart's volume conjecture. The release is a 249-page manuscript collection, a separate reasoning walkthrough document, and Lean 4 certificates on GitHub. The Lean repo reports zero unproven steps, but OpenAI labels the review status "agent-reviewed," formal peer review hasn't happened.

@@MTSlive39

OpenAI: Ten advances in mathematics and theoretical computer science

@u/Salt_Attorney899
Broadcast
OpenAI's Astra JUST solved math...

OpenAI's Astra JUST solved math...

GPT 6 Astra Could Be OpenAI's Biggest Model Yet!

GPT 6 Astra Could Be OpenAI's Biggest Model Yet!

OpenAI's Hidden Model Astra Just Broke Mathematics

OpenAI's Hidden Model Astra Just Broke Mathematics

OpenAI的Astra模型解决了十大著名未解数学难题 — AI 新闻 | Agentic Brew