框架差距:一个62.7%的分数如何变成了99.9%——以及被 ARC Prize 拒绝的 AGI 声称
OpenAI 宣称 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得 99.9% 的成绩,但这一说法一旦与 ARC Prize 自身的数据对比便显得站不住脚。在 OpenAI 专有的 Provider Adapter 框架下——一种可在请求间保留模型不透明推理状态并压缩长对话的封装器——Astra 以 18,817 美元的成本获得了 99.9% 的分数;而在 ARC Prize 标准的、与模型无关的框架下进行最大推理测试时,同一模型在 26,098 美元成本下仅得 62.7%[1]。这并非四舍五入的差异,而是两个戴着同一基准名称外衣的不同测试。OpenAI 高层在发布期间大力使用“通用人工智能”(AGI)的说法——总裁 Greg Brockman 表示‘认为我们现在已进入 AGI 时代并非不合理’[4]——这让接下来的发展显得尤为尖锐而非偶然:ARC Prize 本身作为该基准的创建者,明确拒绝支持这种说法,联合创始人 Mike Knoop 写道:‘我们目前缺乏证据称此为 AGI’[1]。共同创建者 Francois Chollet 则持更乐观看法,认为 Astra 展现出此前需依赖外部框架才能解锁的真实内部符号建模能力,并因此提前了自己的 AGI 时间预测[2]。两种观点可以同时成立:模型可能确实更强,但报告中的数字是框架产物,而非公平的能力评分,且仍远未达到 OpenAI 总裁所提出的 AGI 定位。



