谷歌发布Gemini 4 Argon,引发基准测试与现实表现之争
TECH

谷歌发布Gemini 4 Argon,引发基准测试与现实表现之争

36+
Signals

战略概览

  • 01.
    谷歌于2026年9月30日宣布推出Gemini 4 Argon,称其为迄今最先进的模型,支持高达100万输出token(此前为64K),适用于更长的代理式工作流。
  • 02.
    谷歌正通过其受限的Fairwind计划,率先向经过审核的网络防御机构——包括政府、医疗机构和电信公司——推出Argon,之后再逐步开放API和Google AI Ultra访问权限。
  • 03.
    Argon以每百万输入token 2美元、每百万输出token 10美元的优惠价格首发,约为GPT-6 Astra费率的五分之一,且缓存输入可享受95%折扣。
  • 04.
    谷歌报告称,Argon在AA-Omniscience评估中的幻觉率为15%,是所有在人工分析机构《智能指数》中得分超过45分的模型中最低的,尽管独立测试显示其综合得分与GPT-6 Astra大致持平。

深度分析

基准测试与现实之间的差距

谷歌自身的披露将Argon描绘为前沿模型中基准测试最全面领先的选手,声称在DeepSWE v1.1、CWE-bench和AutomationBench等18项已发布测试中的12项取得压倒性胜利,并在其中一项并列第一[1]。但一旦独立评测方介入验算,这一说法便大打折扣。人工分析机构(Artificial Analysis)自己的《智能指数》显示,Argon(高)得分为53分——与GPT-6 Astra(最大值)完全持平,仅比GPT-6.1 Sol高出1分[2],这幅图景远比谷歌宣称的“全面领先”要平淡得多。

这种差异已演变为一场公开的信任危机,而不仅仅是技术争议。多家媒体报道称,在谷歌此前决定取消Gemini 3.5 Pro发布计划以及多名高级研究员离职后,谷歌员工私下质疑Argon在真实世界中的编码和前端表现是否能匹配其公布的分数[3][4]。Surge AI创始人Edwin Chen对此给出了最尖锐的批评,他将Argon在基准测试与现实表现之间的落差比作一名学生在标准化考试中拿高分却缺乏实际技能,并将这种普遍现象命名为‘benchmaxxing’(唯基准论)[3]。谷歌DeepMind的Koray Kavukcuoglu直接反驳,坚称谷歌必将持续处于AI前沿[3]——值得注意的是,双方均未以公开、可复现的证据来终结这场争论。同样的怀疑情绪也蔓延至主流AI教育类YouTube频道:知名频道Caleb Writes Code的一段广受关注的演示指出,Argon的基准测试胜利尚存争议而非已成定局,并强调鉴于前沿实验室间的竞争节奏之快,今日登顶榜单并不意味着明日仍能保持领先。

15%的幻觉率究竟衡量了什么

Argon的核心幻觉数据——在AA-Omniscience评估中为15%,是所有在《智能指数》中得分超过45分的模型中最低的——确实存在,但常被误读。它并非衡量Argon回答错误的频率;而是追踪当模型不知道答案时,是选择编造一个答案还是选择拒绝回应的比例,相比之下,GPT-6 Astra和GPT-6.1 Sol在同一尺度下的该比例分别为51%和54%[2]。关键在于,Argon在相同的AA-Omniscience基准测试中的原始准确率仅为约50%[2],这意味着该模型大约一半时间答对,另一半时间则很少编造答案——这比‘几乎从不产生幻觉’的说法要保守得多,尽管标题数字容易引发后者误解。

这种细微差别在社交媒体上迅速失真。Reddit论坛r/singularity上一篇获大量点赞的帖子宣称Argon已‘解决幻觉问题’,但很快被顶级评论纠正:用户们在厘清该指标的实际含义后指出事实并非如此。这是一个典型案例,说明一个低而诱人的单一数字传播速度远超其背后的方法论。

为何优先向网络防御者开放

Fairwind计划并非传统的企业准入机制,而是一种刻意设计的双重用途控制策略。谷歌之所以优先向政府、医疗机构和电信公司提供早期访问权限,是因为Argon具备自动发现并协助修复软件漏洞的能力,但若落入别有用心者之手,也可能被用于主动寻找并利用漏洞——因此谷歌希望防御方能在该能力进入公开市场前获得修补漏洞的先机[5][6]。谷歌还表示,未来将向可信防御方和内部团队发布无护栏版本的Argon,以释放其完整的漏洞发掘潜力,但前提是必须配套思维链监控和错位行为缓解机制,以便在模型行为异常时立即中止执行[6]。

这种谨慎态度已开始与用户预期发生冲突。AI工程类YouTuber Sam Witteveen强调了早期访问的严格限制,他在一段基于公开前版本的技术拆解视频中明确指出,由于Argon尚未公开,他无法展示实时模型输出。在r/google_antigravity论坛上,用户报告称,即使付费的Google AI Ultra订阅用户也尚未能使用Argon,尽管谷歌曾声明将很快向API客户和Ultra订阅者扩展访问权限——部分用户指责谷歌在大肆宣传基准测试成绩的同时,却让模型保持足够封闭,以至于公司外部无人能独立验证其主张。一位自称拥有合作伙伴级访问权限的用户反驳了这一叙事,称Argon在编码任务上表现与Claude Opus 5.5相当,并能在长时间会话中保持上下文记忆而不遗忘——虽属未经证实的早期数据点,但至少与最强烈的抱怨形成反差。

价格才是真正的竞争优势

无论基准测试与现实之争最终如何收场,谷歌在Argon上最清晰的竞争杠杆无疑是成本。每百万输入token 2美元、每百万输出token 10美元的优惠定价,仅为GPT-6 Astra $10/$50费率的五分之一左右[1]。人工分析机构计算得出,在折扣定价下运行其《智能指数》任务,Argon的成本约为1.99美元,而GPT-6 Astra为3.26美元——在整体性能相近的情况下,成本仅为其约60%[2]。即便Argon并非在每一项独立测评中都是最聪明的模型,这仍是一个真正差异化的优势。

然而问题在于,目前尚无广泛渠道可实际测试这一成本优势。由于Argon首先被限制在Fairwind计划的防御方使用,且尚未公布面向公众的API或Ultra服务上线日期,这一价格优势在短期内对竞争格局和开发者生态的影响被推迟了[7]——这使得谷歌的成本主张,如同其基准测试主张一样,更多依赖于单方面披露,而非独立可验证的大规模使用验证。

历史背景

谷歌在其官方博客上正式宣布Gemini 4 Argon为其最新前沿模型。
谷歌通过Fairwind计划开始向可信的网络防御方推出Argon,并计划在部署思维链错位监控的前提下发布无护栏版本。
有报道称谷歌员工私下质疑Argon的真实世界表现是否能匹配其基准测试分数,引发了DeepMind高层的公开回应。
根据内部消息来源报道,尽管Gemini 4在基准测试中表现出色,但在某些真实应用场景中仍存在困难。

关键关系图

关键玩家
主题

谷歌发布Gemini 4 Argon,引发基准测试与现实表现之争

GO

Google DeepMind

Gemini 4 Argon的开发者和发布方;掌控分阶段的Fairwind发布流程,设定定价策略、披露哪些基准测试结果,并在发布无护栏版本前部署错位行为缓解机制。

FA

Fairwind Program cyber defenders (governments, healthcare providers, telecom services)

首批受限用户,被授予早期、接近无护栏的访问权限,以便在Argon的漏洞发掘能力进入公开市场前发现并修补漏洞。

OP

OpenAI (GPT-6 Astra) and Anthropic (Claude Opus 5.5)

谷歌直接对标竞争的前沿模型对手;Argon尤其在单位任务成本上显著低于GPT-6 Astra,即便在原始得分未绝对领先的类别中亦然。

AR

Artificial Analysis

独立基准测试评估机构,其《智能指数》显示Argon与GPT-6 Astra基本持平而非绝对领先,削弱了谷歌自身的基准测试主张,并影响了公众对该发布的认知。

事实来源

7 条引用
  1. [1] Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic - but in limited release
  2. [2] Gemini 4 Argon: Google among the top three labs
  3. [3] Google Gemini 4 Argon launch sparks benchmark performance debate
  4. [4] Gemini 4 struggle report
  5. [5] Gemini 4 Argon cyber defenders Fairwind
  6. [6] Google rolls out Gemini 4 Argon to trusted cyber defenders
  7. [7] Google Gemini 4 Argon announcement

来源文章

Top 5

THE SIGNAL.

Analysts

“将Argon在公开基准测试中的优异表现与其现实应用困难之间的差距描述为行业普遍存在的‘benchmaxxing’现象,类比为一名学生在SAT考试中取得顶尖分数却未发展出实际生活技能。”

Edwin Chen
Surge AI创始人

“反驳Argon在实践中表现不佳的说法,坚持认为谷歌必将持续处于AI前沿是确定无疑的。”

Koray Kavukcuoglu
谷歌DeepMind领导层

“发现Argon经独立测量的表现比谷歌自身披露更为平缓,在《智能指数》中得分为53分——与GPT-6 Astra并列,仅比GPT-6.1 Sol高出1分。”

Artificial Analysis
独立AI基准测试机构
The Crowd

“Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from”

@@sundarpichai25840

“Very excited to announce Gemini 4 Argon, our new Frontier AI model, and a huge step forward across key capabilities. We're focused on rolling it out responsibly starting with government and trusted cyber defenders through our Fairwind Program today, before wider availability soon”

@@demishassabis9076

“Google just announced Gemini 4 Argon, their next model. It's SoTA. It's so good they are working with the US Government and cyber security testers before release (just like Mythos, Astra) Google says they used it to profile and optimize their data centers globally, saving 300TB”

@@mweinbach1139

“Gemini 4 Argon solved hallucinations.”

@u/drhenriquesoares1500
Broadcast
Gemini 4 Argon explained in 5min..

Gemini 4 Argon explained in 5min..

Gemini 4 Argon

Gemini 4 Argon

Google unveils Gemini 4 Argon

Google unveils Gemini 4 Argon

谷歌发布Gemini 4 Argon,引发基准测试与现实表现之争 — AI 新闻 | Agentic Brew