取决于你愿意支付多少费用的基准测试
OpenAI的发布材料大力强调了一个ARC-AGI-3得分接近99的亮眼成绩,但该基准测试的作者几小时内便提出异议。ARC Prize基金会联合创始人弗朗索瓦·肖莱(Francois Chollet)确认,Astra在交互式推理问题上确实实现了跃迁式进步——但他指出,该模型在标准测试框架下的得分为66%,只有在使用昂贵的定制连续对话框架并进行人工压缩时才接近100%,每局游戏成本约为360美元[1]。ARC Prize自己的分析明确表示,即使在基准测试中达到饱和,也不等于‘实现AGI的证明’[1]。OpenAI还吹捧了其他方面的强劲表现——FrontierMath Tier 4 v2得分为97.6%,GPQA Diamond得分为96%,BenchCAD得分为95.9%,DeepSWE v1.1得分为74.1%——这些数据在X平台上的基准汇总帖(如@wallstengine的帖子)中广泛传播,而非出现在OpenAI自己的发布页面上。独立聚合机构Artificial Analysis进一步指出,Astra的广义智能指数为61,与前代模型GPT-5.6 Sol完全相同,尽管通过API运行Astra的成本约为前者的2.5倍[2]。质疑不仅来自专业基准机构:在Reddit上,自称电气工程师的用户拆解了OpenAI发布材料中的PCB/硬件设计演示,指出基本的设计规则检查失败、悬浮的地平面和丝印错误——这虽非正式审计,但社区反应与肖莱和Artificial Analysis在基准测试中指出的‘营销超越实际能力’模式如出一辙。


