基准测试与现实之间的差距
谷歌自身的披露将Argon描绘为前沿模型中基准测试最全面领先的选手,声称在DeepSWE v1.1、CWE-bench和AutomationBench等18项已发布测试中的12项取得压倒性胜利,并在其中一项并列第一[1]。但一旦独立评测方介入验算,这一说法便大打折扣。人工分析机构(Artificial Analysis)自己的《智能指数》显示,Argon(高)得分为53分——与GPT-6 Astra(最大值)完全持平,仅比GPT-6.1 Sol高出1分[2],这幅图景远比谷歌宣称的“全面领先”要平淡得多。
这种差异已演变为一场公开的信任危机,而不仅仅是技术争议。多家媒体报道称,在谷歌此前决定取消Gemini 3.5 Pro发布计划以及多名高级研究员离职后,谷歌员工私下质疑Argon在真实世界中的编码和前端表现是否能匹配其公布的分数[3][4]。Surge AI创始人Edwin Chen对此给出了最尖锐的批评,他将Argon在基准测试与现实表现之间的落差比作一名学生在标准化考试中拿高分却缺乏实际技能,并将这种普遍现象命名为‘benchmaxxing’(唯基准论)[3]。谷歌DeepMind的Koray Kavukcuoglu直接反驳,坚称谷歌必将持续处于AI前沿[3]——值得注意的是,双方均未以公开、可复现的证据来终结这场争论。同样的怀疑情绪也蔓延至主流AI教育类YouTube频道:知名频道Caleb Writes Code的一段广受关注的演示指出,Argon的基准测试胜利尚存争议而非已成定局,并强调鉴于前沿实验室间的竞争节奏之快,今日登顶榜单并不意味着明日仍能保持领先。


