Google发布Gemini 4 Argon
TECH

Google发布Gemini 4 Argon

88+
Signals

战略概览

  • 01.
    Google DeepMind于2026年9月30日通过Google DeepMind高级副总裁兼首席AI架构师Koray Kavukcuoglu的官方博客文章宣布了Gemini 4 Argon,将其定位为公司的下一代前沿模型。
  • 02.
    该模型将Google的输出令牌限制从64,000提升至100万,Google称这使其能够进行更深入、多步骤的问题解决。
  • 03.
    Argon将首先向通过Fairwind计划的可信网络安全防御者推出,且初期不设网络防护机制;该计划启动时已有超过650个合作伙伴,包括政府机构和Google Cloud客户;付费API用户和Google AI Ultra订阅用户将紧随其后,但尚未公布具体时间表。
  • 04.
    安全公司Wiz通过Google的“Scan for Good”计划提前试用Argon,发现了全球医院软件中的一个关键漏洞,而此前的前沿模型均未发现此问题;Google尚未披露该软件名称或确认补丁已部署。
  • 05.
    初始定价为每百万输入令牌2美元,每百万输出令牌10美元,优惠期结束后将升至4美元/20美元,缓存的输入令牌可享受95%折扣。
  • 06.
    Google表示,Argon在18至19项公开基准测试中的12到13项上领先或持平于GPT-6 Astra和Claude Opus 5.5,胜出类别数量超过任一竞争对手。

深度分析

Google图表与独立复现之间的基准差距

Google声称Argon在18至19项公开基准测试中的12到13项上领先或持平于GPT-6 Astra和Claude Opus 5.5,其中包括自报的DeepSWE v1.1得分为77.9% [1]。然而,这一DeepSWE分数是Google自行计算的结果,在独立的DataCurve排行榜上根本不存在——该榜单最高分仅为74%,其中一位并列榜首正是Google自家更小的Gemini 3.8 Flash。其他独立评估结果也呈现分歧而非确认领先:Vals AI将Argon列为41个模型中的第一名,而Artificial Analysis的智能指数给其评分53分,与GPT-6 Astra持平,落后于Claude Opus 5.5的60分 [2],并在其价格区间内的223个模型中仅排第八,编码专项测试中Claude Sonnet 5.5表现更优。这些争议不会通过争论解决,而是需要在陌生代码库上运行模型来验证——而目前几乎只有Fairwind计划之外的人无法做到这一点。

为何网络安全防御者优先获得Argon,而防护机制居次

Argon的首次发布面向超过650名Fairwind计划伙伴——即受信任的网络安全防御者、政府机构和Google Cloud客户 [3],而非通过公共API开放。Google的解释是,一款能自主发现、验证并修补漏洞的模型,必须先由真实防御者对其安全机制进行压力测试,方可广泛发布 [4]。这一策略已初见成效:安全公司Wiz通过免费扫描项目使用Argon,揭示了一个早期前沿模型均未察觉的医院软件关键漏洞 [5]。但此举也带来了形象上的代价——Google正在营销“软件工程”作为该模型的核心能力,而绝大多数软件工程师却尚无法接触该模型 [6]。

十个月、一次股价下滑,以及Google亟需的一次回归

Argon的发布距离Google上一代旗舰Gemini 3 Pro(2025年11月发布)约十个月 [7],这段时间足以让OpenAI的GPT-6 Astra和Anthropic的Claude Opus 5.5相继问世,并引发分析师关于DeepMind已失去前沿地位的讨论。在此压力下,Alphabet股价从5月高点下跌了16% [8]。此次发布恰逢CEO Sundar Pichai在白宫签署自愿性AI安全协议的次日 [9],华尔街反应谨慎乐观而非全然信服:Jefferies和KeyBanc均维持对Alphabet的买入评级,目标价分别为445美元和435美元 [8][10],但同一股票的牛市预期(485美元)与熊市预期(295美元)之间的巨大差距 [8]表明市场将Argon视为证据,而非证明Google已追平差距的确凿事实。

‘刷榜’言论揭示了自报AI评分卡的真相

两名Google员工向彭博社透露,该模型看起来像是‘刷榜’产物——针对披露图表进行了优化,而非为日常实际工作表现设计 [11](该说法仅以片段形式出现,非完整验证文章)。另一项独立分析发现,Argon在广泛用于衡量模型质量的基准测试中表现良好,但在员工实际使用中表现不佳 [12]。这种内部怀疑与公众对其“幻觉率”宣传的反应相呼应:最初宣称的15%最低幻觉率(在Artificial Analysis智能指数得分45及以上的模型中最低)[2]被解读为“幻觉已被解决”的证据,直到技术背景较强的读者指出,该指标衡量的是“错误时拒绝响应”而非整体错误率,并对此更强表述提出反驳。结合员工自身的怀疑,这一模式表明,对自报基准表的真实考验已不再是数字是否够高,而是外部方能否快速复现这些结果——而在复现完成前,实验室的图表与其员工对该模型的实际体验完全可以背道而驰。

历史背景

Gemini 2.5 Pro发布,具备更强的推理和编码能力。
Gemini 3 Pro作为首款Gemini 3系列模型发布——即Argon之前的上一代旗舰,意味着在Argon之前约10个月内Google未推出新旗舰。
Gemini 3.1 Pro迭代更新发布。
Fairwind计划启动,作为面向政府、Google Cloud客户及网络安全伙伴的有限早期访问项目,首发即有650多个参与伙伴。
Pichai在白宫与特朗普总统及其他科技高管签署自愿性AI安全协议,时间为Argon发布前一天。
宣布Gemini 4 Argon并开始通过Fairwind计划向可信网络安全防御者推广。

关键关系图

关键玩家
主题

Google发布Gemini 4 Argon

GO

Google DeepMind

Gemini 4 Argon的开发者

SU

Sundar Pichai

Alphabet/Google CEO;公开推广Argon发布,并在发布前一天与白宫签署自愿性AI安全协议

KO

Koray Kavukcuoglu

Google DeepMind高级副总裁兼首席AI架构师;撰写官方公告博客

LO

Logan Kilpatrick

Google;在X平台宣布Argon的推广计划和定价

WI

Wiz

网络安全公司,通过其‘Scan for Good’计划使用Argon发现关键医疗软件漏洞

FA

Fairwind Program partners (650+)

可信网络安全防御者、政府机构和Google Cloud客户,率先获得Argon访问权限

OP

OpenAI (GPT-6 Astra)

Google将Argon与之对比的竞争对手模型

AN

Anthropic (Claude Opus 5.5)

Google将Argon与之对比的竞争对手模型

U.

U.S. government

参与Argon在广泛发布前的自愿性预访问流程

GO

Google employees

内部怀疑者,据称发现Argon在实际编码工作中表现不如基准测试

JE

Jefferies / KeyBanc

股票分析师,在Argon发布后发布对Alphabet的买入/增持评级(目标价分别为445美元和435美元)

AR

Artificial Analysis

独立AI基准测试机构,对Argon与竞争对手进行了评估

事实来源

12 条引用
  1. [1] Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic, but in limited release
  2. [2] Gemini 4 Argon: Google Returns to the Top Three AI Labs
  3. [3] Gemini 4 Argon: 650+ Partners Join the Fairwind Program
  4. [4] Google Gemini 4 Argon launches with restricted access
  5. [5] Google Gemini 4 Argon
  6. [6] Gemini 4 Argon Tops the Benchmarks, You Can't Use It: Here's What Actually Matters
  7. [7] Google Gemini Model Release Timeline
  8. [8] Alphabet (GOOG) Stock at $344: Gemini 4 Argon Bull Case $485, Bear Case $295
  9. [9] Sundar Pichai Signs AI Safety Agreement, Promotes Gemini 4 Argon
  10. [10] KeyBanc Reiterates Alphabet Stock Rating on Gemini 4 Progress
  11. [11] Google Grapples With Employee Skepticism About New Gemini Model
  12. [12] Gemini 4 Argon Must Reverse Google's AI Inertia

来源文章

Top 5

THE SIGNAL.

Analysts

“将Argon的发布视为Google AI信誉的生死时刻,此前近一年无具竞争力的前沿模型;他认为Argon在基准测试上有竞争力,但Google必须证明其现实应用价值才能重获信任。”

Daniel Bader (9to5Google)
科技记者/分析师

“两人向彭博社表示,该模型似乎受到‘刷榜’影响——为基准测试优化,而非为实用的现实任务设计。”

Unnamed Google employees (via Bloomberg)
内部怀疑者

“Argon对提示词极为敏感——输出质量/风格高度依赖提示方式,其默认的3D场景生成美学相较于Claude Opus 5处于中等水平。”

Unnamed developers (X/social commentary)
早期测试者

“指出Argon公布的基准优势与真实客户访问之间存在实际差距,并将此次发布置于Google领导层变动的背景下审视。”

VentureBeat analysis
行业评论
The Crowd

“Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.”

@@GoogleDeepMind41809

“Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from ...”

@@sundarpichai24645

“Introducing Gemini 4 Argon, our new frontier model, rolling out to cyber defenders starting today, and more widely as soon as possible. I am really excited by the progress we have made here. Argon is priced at $2 in and $10 out during introductory pricing!”

@@OfficialLoganK14382

“Gemini 4 Argon: our next era of frontier intelligence”

@u/Thistlemanizzle1600
Broadcast
【速報】Gemini 4 Argon登場!公式ベンチ19項目中13項目で1位、Googleの逆襲!

【速報】Gemini 4 Argon登場!公式ベンチ19項目中13項目で1位、Googleの逆襲!

Gemini 4 Argon: Google is back at the TOP of AI rankings!

Gemini 4 Argon: Google is back at the TOP of AI rankings!

Gemini 4 Argon: Is Google Actually Back?

Gemini 4 Argon: Is Google Actually Back?