GPT-6 Astra 发布及基准测试操纵争议
TECH

GPT-6 Astra 发布及基准测试操纵争议

30+
Signals

战略概览

  • 01.
    OpenAI 于2026年9月3日以有限预览形式发布了 GPT-6 Astra,逐步向 ChatGPT Plus、Pro、Business 和 Enterprise 用户以及 API、Azure 和 AWS Bedrock 推出,并发布了一篇博客文章,宣称其在基准测试中的显著提升,但这些说法很快引发了质疑。
  • 02.
    发布后不到一天,报道披露 OpenAI 已悄悄修改了至少五项已发布的评估数据——包括幻觉率、ExploitBench 网络安全评分和 ARC-AGI-3——这些修改均有利于 Astra,部分数值在发布后仍在持续调整。
  • 03.
    其中最具影响力的单一数据是 ARC-AGI-3:OpenAI 使用其专有的 Provider Adapter 框架报告得分为 99.9%,而当基准创建者 ARC Prize 使用其自身中立、与模型无关的框架进行测试时,同一模型仅得 62.7%。
  • 04.
    独立基准测试公司 Artificial Analysis 发现,Astra 的整体智能指数与其前代产品基本持平,且落后于 Anthropic 的 Claude Fable 5.1,这与 OpenAI 公布图表所暗示的巨大进步相矛盾。

深度分析

框架差距:一个62.7%的分数如何变成了99.9%——以及被 ARC Prize 拒绝的 AGI 声称

OpenAI 宣称 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得 99.9% 的成绩,但这一说法一旦与 ARC Prize 自身的数据对比便显得站不住脚。在 OpenAI 专有的 Provider Adapter 框架下——一种可在请求间保留模型不透明推理状态并压缩长对话的封装器——Astra 以 18,817 美元的成本获得了 99.9% 的分数;而在 ARC Prize 标准的、与模型无关的框架下进行最大推理测试时,同一模型在 26,098 美元成本下仅得 62.7%[1]。这并非四舍五入的差异,而是两个戴着同一基准名称外衣的不同测试。OpenAI 高层在发布期间大力使用“通用人工智能”(AGI)的说法——总裁 Greg Brockman 表示‘认为我们现在已进入 AGI 时代并非不合理’[4]——这让接下来的发展显得尤为尖锐而非偶然:ARC Prize 本身作为该基准的创建者,明确拒绝支持这种说法,联合创始人 Mike Knoop 写道:‘我们目前缺乏证据称此为 AGI’[1]。共同创建者 Francois Chollet 则持更乐观看法,认为 Astra 展现出此前需依赖外部框架才能解锁的真实内部符号建模能力,并因此提前了自己的 AGI 时间预测[2]。两种观点可以同时成立:模型可能确实更强,但报告中的数字是框架产物,而非公平的能力评分,且仍远未达到 OpenAI 总裁所提出的 AGI 定位。

一篇改了四次主意的博文

互联网档案馆对 OpenAI 发布页面的快照显示,公布的数字在发布期间及之后多次变动,不止一次。Astra 的幻觉率最初在美东时间下午2:23的快照中为 4.2%,随后修订为 2%,之后又恢复为 4.2%——与此同时,与 GPT-5.6 Sol 的对比数据也发生变动,最终回到 12.2%[3]。GPT-5.6 Sol 的 ExploitBench 网络安全评分在发布中途翻倍,从 5.5% 升至 11.5%;OpenAI 后来表示正在调查是否应撤销该数据,因其反映的是尚未商业可用的推理层级[3]。发给媒体的保密版 ARC-AGI-3 分数为 98.6%,正式发布时变为 99.99%[3],甚至竞争对手的数据也在变动:Anthropic 的 Fable 5.1 FrontierMath 对比分数在不同快照间下降近10个百分点,从 87.8% 降至 78%[3]。Snorkel AI 的 Vincent Sunn Chen 提供了更宽容的解读,认为这些修改属于典型的最终发布流程,而非刻意操纵[3],而斯坦福研究人员 Anka Reuel 和 Mike Hardy 则指出系统卡缺乏关于幻觉率等内部评估方法的充分文档说明,并认为这些修改恰好有利于营销叙事[3]

OpenAI 的‘关键级’网络安全声称建立在同一不稳定数据之上

OpenAI 的发布博客声称 Astra 是该公司首个在其自有的 Preparedness Framework 下达到‘关键级’(Critical)网络安全能力的模型[4]——这是 OpenAI 用于在模型发布前触发额外安全审查的内部框架。该分类并非营销注脚,而是旨在成为衡量模型现实风险的触发机制。然而,支撑 Astra 网络安全叙事的主要证据——ExploitBench 分数——正是此次发布已证明极不稳定的类型:GPT-5.6 Sol 的 ExploitBench 数据在 OpenAI 自家博客的不同版本间从 5.5% 跃升至 11.5%,OpenAI 将此归因于一个尚未商业化的推理层级[3]。当支撑安全相关能力阈值的底层基准在同一次发布周期内波动如此之大时,建立其上的‘关键级’认定也就继承了所有其他争议数据的可信度问题:很难判断若采用早期较低分数,该分类是否仍能成立,或它是否只是恰好选用了能跨过门槛的版本。

独立基准测试实际显示的结果

与第三方测试相比,Astra 的表现远不如 OpenAI 自家图表所暗示的那样惊人。Artificial Analysis 的智能指数将 Astra 评为 61.2,与其前代 GPT-5.6 Sol 的 60.9 基本持平,且落后于 Anthropic 的 Claude Fable 5.1(65.7)[5]——这与一场被宣传为代际飞跃的发布难以调和。具体到幻觉方面,Artificial Analysis 自行测试发现,Astra 在最大努力下的幻觉率为 51%,虽低于 Sol 的 92%,确有进步,但远未达到 OpenAI 公布的低于 5% 的数据[6]。独立测量与 OpenAI 自家图表对同一发布讲述了两个不同的故事,而只有前者能在 OpenAI 自身基础设施之外复现。

这是第三次,而非第一次

GPT-6 Astra 的基准争议对 OpenAI 而言并非孤立事件。2024年末,其 o3 模型声称在 FrontierMath 基准测试中取得 25% 的分数,但独立测试无法复现,Epoch AI 的测试结果接近 10%[7]。后来发现,OpenAI 曾秘密资助并提前获取 FrontierMath 数据集,却未向参与的学术贡献者披露这一安排[8]。更近的例子是 GPT-5.5,用户发现其高级 Extended Thinking 模式在许多查询中被悄然降级,引发批评[9]。当模式显现后,公众对 Astra 的反应迅速分化。在 X 平台上,一条最初热捧原始头条数据(近乎完美的 ARC-AGI-3、ExploitBench 和 SRE Bench 分数)的推文,在约一天内转为更怀疑的氛围,评论员纷纷放大关于静默修改指标的报道。Reddit 帖子展开了广泛辩论,评论者称之为‘benchmaxxing’——究竟 OpenAI 专有框架下的 ARC-AGI-3 分数还是 ARC Prize 中立框架下的分数更能公平衡量现实世界代理能力——其间充斥着误导性营销的指控,也伴有辩护者认为增强框架评分是合理的能力信号。YouTube 的报道则更为冷静:分析人士提供审慎观点,既捍卫基准本身的严谨性,也承认真实的幻觉改善程度远不如头条数据所示,并提出解释分数跃升的架构理论——这种语调明显不同于 X 和 Reddit 上的炒作-反弹循环。即便是 OpenAI 自身的发布机制也加剧了怀疑——发布帖比预定时间延迟近两小时,公司后来为此道歉,并向未能在首日获得访问权限的付费订阅者提供补偿[10]

历史背景

OpenAI 的 o3 模型曾因声称在 FrontierMath 基准测试中取得 25% 分数却无法被独立复现而陷入基准透明度争议,Epoch AI 的测试结果接近 10%。
后来发现 OpenAI 在 o3 发布前曾秘密资助并提前获取 FrontierMath 基准数据集,但未向参与的学术贡献者披露该安排。
GPT-5.5 因用户发现其高级 Extended Thinking 模式在许多查询中被悄然降级,引发全行业‘虚假思考’争议。
GPT-6 Astra 以有限预览形式发布,博客文章推出过程混乱且延迟——原定美东时间下午2点发布,但近两小时后才广泛可读,随后爆发基准数据修改争议。

关键关系图

关键玩家
主题

GPT-6 Astra 发布及基准测试操纵争议

OP

OpenAI

Model developer and publisher of the disputed benchmark figures; controls the blog post, system card, and evaluation harness used to generate favorable scores; defended the post-launch edits to press as routine verification.

AR

ARC Prize Foundation (Francois Chollet, Mike Knoop)

Independent creators of the ARC-AGI-3 benchmark; ran Astra under their own neutral harness (62.7%) versus OpenAI's Provider Adapter (99.9%), and publicly declined to endorse OpenAI's AGI framing of the result.

AR

Artificial Analysis

Independent benchmarking firm whose Intelligence Index and hallucination testing contradicted OpenAI's self-reported gains, placing Astra roughly level with its predecessor and behind a rival model.

ST

Stanford researchers (Anka Reuel and Mike Hardy)

Academic critics who reviewed Astra's system card and flagged inadequate documentation of internal benchmarks such as hallucination rate.

AN

Anthropic

Competitor whose Claude Fable 5.1 model figures shifted within OpenAI's own comparison charts and reportedly outperforms Astra on independent indices.

事实来源

10 条引用
  1. [1] OpenAI Astra ARC-AGI-3 harness: 62.7% vs 99.9% benchmark revisions
  2. [2] Benchmarks disagree on GPT-6 Astra but its human-beating efficiency on ARC-AGI-3 pulls Chollet's AGI forecast forward
  3. [3] OpenAI quietly boosts some of Astra's evaluation metrics amid rare delay in publication of the model blog post announcement
  4. [4] OpenAI's Astra, GPT-6, and Greg Brockman on the AGI era
  5. [5] Benchmarking GPT-6 Astra
  6. [6] GPT-6 Astra vs 5 Sol for hallucination, omniscience, accuracy (2026)
  7. [7] OpenAI's o3 AI model scores lower on a benchmark than the company initially implied
  8. [8] We made a mistake in not being more transparent: OpenAI secretly accessed benchmark
  9. [9] GPT-5.5 fake thinking: silent downgrades AI controversy
  10. [10] GPT-6 Astra arrives with major gains, staged access, and new questions about its benchmarks

来源文章

Top 5

THE SIGNAL.

Analysts

直接反驳了 OpenAI 关于 ARC-AGI-3 结果是 AGI 证据的说法,强调该组织并未做出此类声明。

Mike Knoop
ARC Prize 基金会联合创始人

认为 Astra 展现出此前需依赖外部框架才能实现的真实内部符号建模能力,并因此提前了自己的 AGI 时间预测。

Francois Chollet
ARC-AGI 基准系列共同创建者

批评 Astra 的系统卡在关键内部评估的方法论透明度上不足,暗示指标修改恰好有利于 OpenAI 的营销叙事。

Anka Reuel and Mike Hardy
斯坦福大学研究人员

提供了更宽容的解读,将指标变化视为典型的最后一刻发布流程,而非蓄意操纵。

Vincent Sunn Chen
Snorkel AI

暗示 Astra 的成果可能标志着 AGI 的到来,但这一框架遭到了基准创建者本人的拒绝。

Greg Brockman
OpenAI 总裁
The Crowd

OpenAI quietly altered the performance metrics it reported for GPT-6-Astra in ways that favored the new model, and it continues to change others post-launch. Good reporting here from @EmilyForlini

@@jeremyakahn204

Interesting report from FORTUNE: @OpenAI quietly changed several GPT-6 Astra benchmark results around the model's launch, with some changes making Astra look better and competing models worse. One of the biggest examples: Astra's reported hallucination rate went from 4.2% to 2%, before later being changed back to 4.2%. Anthropic Fable 5.1's FrontierMath score also moved from 87.8% to 78%, then back up to 83%. This happened during the strange delay of the Astra launch blog, which was initially published, pulled, and then republished with different numbers. OpenAI says the delay was unrelated to the benchmarks and that eval results can shift depending on the exact checkpoint, harness and reasoning configuration.

@@mark_k274

🚨GPT 6 Astra benchmarks are absolutely ridiculous • ARC AGI 3: 98.6% • ExploitBench: 100% • SRE Bench: 99.2% • AutomationBench: 41.4% What the hell did OpenAI cook up here ??

@@LuminaBench2497

Gpt 6 astra benchmarks

@u/CounterReady47742600
Broadcast
GPT 6 Astra, so good even OpenAI are worried

GPT 6 Astra, so good even OpenAI are worried

GPT-6 Astra Just Went CRITICAL...

GPT-6 Astra Just Went CRITICAL...

GPT-6 Astra Benchmarks: What the AI Industry Won't Tell You

GPT-6 Astra Benchmarks: What the AI Industry Won't Tell You