欢迎来到AGI时代——还是并非如此?
格雷格·布罗克曼(Greg Brockman)宣布的不仅是一个新模型,更是一个新时代。他将Astra称为‘代际飞跃’,并将OpenAI自身的AGI阈值重新定义为‘一种使命概念或精神概念’[1]。这种软化至关重要:就在公司声称已跨越该门槛的同一周,放宽定义使OpenAI得以在修辞上宣称达成里程碑,而无需承担正式声明所引发的严格审查。
这些基准数据确实令人瞩目——Astra在FrontierMath Tier 4中达到98%,ARC-AGI-3中达到99.9%,ExploitBench中达到100%[2]——但加里·马库斯(Gary Marcus)直接反驳了将基准饱和等同于AGI的观点:“在ARC-AGI上取得成功固然出色且令人印象深刻,但并不能——尽管任务名称如此——证明实现了AGI”[3]。他还指出,与热情的早期测试者不同,持怀疑态度的研究人员在发布前未被提前授予评估模型的权限。
OpenAI的叙事框架与马库斯的质疑之间的差距,比基准分数本身更能揭示此次发布的真正故事。


