Google图表与独立复现之间的基准差距
Google声称Argon在18至19项公开基准测试中的12到13项上领先或持平于GPT-6 Astra和Claude Opus 5.5,其中包括自报的DeepSWE v1.1得分为77.9% [1]。然而,这一DeepSWE分数是Google自行计算的结果,在独立的DataCurve排行榜上根本不存在——该榜单最高分仅为74%,其中一位并列榜首正是Google自家更小的Gemini 3.8 Flash。其他独立评估结果也呈现分歧而非确认领先:Vals AI将Argon列为41个模型中的第一名,而Artificial Analysis的智能指数给其评分53分,与GPT-6 Astra持平,落后于Claude Opus 5.5的60分 [2],并在其价格区间内的223个模型中仅排第八,编码专项测试中Claude Sonnet 5.5表现更优。这些争议不会通过争论解决,而是需要在陌生代码库上运行模型来验证——而目前几乎只有Fairwind计划之外的人无法做到这一点。


