AGI头条数字在更严格测试下未能站稳脚跟
Astra最引人注目的分数来自有状态、工具辅助的评估运行,包括在ARC-AGI-3上接近完美的结果[6]。但在ExploitBench上,一旦基准测试被重构以排除历史已披露漏洞,其‘完美’的100%得分便骤降至39%[6]——这强烈表明部分峰值表现反映的是对已知漏洞的记忆,而非真正的新型发现。然而,OpenAI自身的表述却极力强调相反结论:总裁格雷格·布罗克曼称,认为行业已进入AGI时代“并非不合理”[8]。一篇广受关注的开发者评测则完全采用另一种衡量方式反驳了这一说法——一个独立的、非基准游戏化的智能指数显示,尽管Astra的基准测试成绩看似全面领先,但其实际水平与前代模型相当,甚至落后于竞争对手实验室的模型。


![Why GPT-6 Astra Drops from 99.9% to 62.7% [Complete Breakdown]](https://img.youtube.com/vi/g5rJ-gkrBcA/mqdefault.jpg)