AGI 主张未能经受住独立基准测试的检验
OpenAI 将 GPT-6 Astra 宣传为其迄今为止最智能、最对齐的模型,公布了在 ARC-AGI-3 上达到 99.9%、FrontierMath Tier 4 达到 98%、ExploitBench 达到 100% 的成绩[1]。OpenAI 总裁Greg Brockman进一步表示,该模型以超人速度使用计算机意味着‘认为我们已进入 AGI 时代并非不合理’[3]。然而,独立基准测试公司 Artificial Analysis 发现,Astra 在其 Intelligence Index 上得分为 61 分,与前代模型 GPT-5.6 Sol 完全持平,且比 Anthropic 的 Claude Fable 5.1 落后五分[2]。福布斯撰稿人Ron Schmelzer甚至在基准结果出炉前就提出了相关质疑,他怀疑 Astra 是否符合 OpenAI 自己定义的 AGI 标准,因为其表观能力很大程度上依赖于周边工具而非模型本身[4]。OpenAI 的宣传口径与中立第三方实际测量之间的差距,清楚表明 Astra 的发布既是营销和竞争行为,也是技术突破。


