基于选择性基准测试的回归
谷歌正将Gemini 4 Argon定位为在近期被OpenAI的GPT-6 Astra和Anthropic的Claude Opus 5.5抢走风头后,重新夺回前沿模型领导地位的回归之作[1]。该模型在公布的18项基准测试中领先或持平13项,其最大优势体现在企业知识工作领域:在Harvey法律代理基准测试中,Argon得分为19.6%,而GPT-6 Astra为5.4%,Claude Opus 5.5为3.8%;在AutomationBench测试中,Argon得分为51.3%,而上述两个竞争对手分别为42.5%和41.4%[1]。在真实软件工程任务中,Argon在DeepSWE v1.1上取得77.9%的成绩,再次领先于两位竞争者[1]。但在两项专门针对编码的测试中,情况则相反——GPT-6 Astra在FrontierSWE v2中领先超过10个百分点(65.5%对55.0%),而Claude Opus 5.5在Terminal-Bench 4.0中领先(66.4%对57.4%)[1]。这种分化并未被忽视:Reddit的r/singularity社区发帖指责谷歌“基准测试优化”(benchmaxxing),认为Argon最强得分集中在测试套件中较简单的部分,并引用彭博社报道称,一些实际使用该模型的员工发现,尽管其纸面成绩亮眼,但在某些现实编码任务中表现吃力。谷歌的宣传重点在于模型的广泛能力而非单一分数——DeepMind的Gemini产品负责人Tulsee Doshi称Argon是“在多个领域具备前沿能力的均衡模型”,而非专为基准测试优化的专家型模型[2]。


