基准测试数据存在‘星号问题’
OpenAI的发布材料显示,GPT-6 Astra在ARC-AGI-3上达到99.9%的得分,远高于GPT-5.6 Sol的7.8%和Anthropic的Opus 5的30.2%[1],但这一数据来自OpenAI自有的有状态适配器测试框架;独立的无状态测试结果显示,Astra的得分在17%至63%之间,具体取决于推理层级[1]。ExploitBench上也出现了类似情况:OpenAI报告Astra得分为完美的100%,但基于2026年6月至8月漏洞构建的、去污染版本的测试中,Astra得分为39.0%,而GPT-5.6 Sol为5.5%[1]——尽管仍是一次真实跃升,但远小于营销宣传所暗示的幅度。FrontierMath Tier 4是Epoch AI独立构建的基准测试,由七十多位人类数学家参与设计,且无OpenAI介入,其公布的约98%的得分似乎是唯一经得起推敲的标志性数据[1]。更复杂的是,Astra在一个第三方模型指数中排名靠前,但在Artificial Analysis的智能指数中却落后于Anthropic的Claude Fable 5.1[2],这提醒我们,‘业界领先’的定义高度依赖于测量者及其方法。



