谷歌Gemini 4 Argon企业级与网络安全模型发布
TECH

谷歌Gemini 4 Argon企业级与网络安全模型发布

25+
Signals

战略概览

  • 01.
    谷歌于2026年9月30日宣布推出Gemini 4 Argon,这是一款专为复杂专业工作流设计的新型前沿模型,涵盖软件工程、企业知识工作和网络安全防御等领域。
  • 02.
    Argon将首先通过谷歌的Fairwind计划向首批受信任的网络安全防御者推出,其中包括一个移除了网络安全防护机制的版本,随后再进行更广泛的发布。
  • 03.
    Argon将单次输出的token上限提升至100万个(此前为64,000个),并以每百万输入token 2美元、每百万输出token 10美元的优惠价格首发。
  • 04.
    一旦谷歌完成额外测试以及美国政府的自愿性发布前模型访问流程,该模型将向付费API客户和Google AI Ultra订阅用户全面开放。

基于选择性基准测试的回归

谷歌正将Gemini 4 Argon定位为在近期被OpenAI的GPT-6 Astra和Anthropic的Claude Opus 5.5抢走风头后,重新夺回前沿模型领导地位的回归之作[1]。该模型在公布的18项基准测试中领先或持平13项,其最大优势体现在企业知识工作领域:在Harvey法律代理基准测试中,Argon得分为19.6%,而GPT-6 Astra为5.4%,Claude Opus 5.5为3.8%;在AutomationBench测试中,Argon得分为51.3%,而上述两个竞争对手分别为42.5%和41.4%[1]。在真实软件工程任务中,Argon在DeepSWE v1.1上取得77.9%的成绩,再次领先于两位竞争者[1]。但在两项专门针对编码的测试中,情况则相反——GPT-6 Astra在FrontierSWE v2中领先超过10个百分点(65.5%对55.0%),而Claude Opus 5.5在Terminal-Bench 4.0中领先(66.4%对57.4%)[1]。这种分化并未被忽视:Reddit的r/singularity社区发帖指责谷歌“基准测试优化”(benchmaxxing),认为Argon最强得分集中在测试套件中较简单的部分,并引用彭博社报道称,一些实际使用该模型的员工发现,尽管其纸面成绩亮眼,但在某些现实编码任务中表现吃力。谷歌的宣传重点在于模型的广泛能力而非单一分数——DeepMind的Gemini产品负责人Tulsee Doshi称Argon是“在多个领域具备前沿能力的均衡模型”,而非专为基准测试优化的专家型模型[2]。

防护机制放宽,仅限受信用户

Argon的发布并非全面开放,而是通过谷歌的Fairwind计划进行,该计划向首批网络安全防御者提供一个移除了网络安全防护机制的版本,使其可用于真实的漏洞挖掘工作,而非经过净化的演示环境[2]。谷歌将此称为有意识的分阶段策略,表示将“在继续从早期测试者收集反馈的同时迭代防护机制,然后再更广泛地提供Argon”[2]。这一策略已初见成效:安全公司Wiz通过其“Scan for Good”计划使用Argon,发现了一款全球医院广泛使用的软件中的关键漏洞,而此前的前沿模型均未能发现该问题[3]。这正是早期发布防护机制减弱版本的最强有力论据,但也是此次发布中最明显的双重用途矛盾——正如谷歌自己承认的,使Wiz能够发现医疗漏洞的同一能力,目前仍在针对安全防护机制进行调优,尚未向受信群体之外的用户开放。目前,访问权限通过美国政府的自愿性发布前模型访问流程,以及部分关键基础设施运营商进行管理,待额外测试完成后,付费API客户和Google AI Ultra订阅用户将紧随其后[4]。

以定价作为第二卖点

除了基准测试,谷歌还通过成本优势进行竞争。Argon以每百万输入token 2美元、每百万输出token 10美元的优惠价格发布,缓存的输入token可享受95%的折扣,之后将上调至标准价格每百万token 4美元/20美元[4]。这一价格比GPT-6 Astra的10美元/50美元低约五分之一,约为Claude Opus 5.5的4美元/20美元的一半[1]。独立基准测试机构Artificial Analysis发现,Argon在情报指数上与GPT-6 Astra持平,但每项任务成本仅为其60%左右,结论是谷歌“重新成为智力水平前三的实验室之一”。结合新扩展的100万token单次输出上限——是此前64,000 token上限的16倍[4]——谷歌的策略是,对于企业客户而言,更便宜、更长的单次生成能力将比在每一项基准测试中获胜更为重要。

数据说话:Argon真正领先之处

抛开与竞争对手的直接对比,基准测试数据本身揭示了Argon真正强势的领域。它在CWE-bench v1上以68%的成绩并列第一[4],在长视频理解测试LVBench上创下91.7%的当前最佳成绩[5],在Gray Swan间接提示注入测试中,攻击者成功率仅为0.7%,是迄今为止所有测试模型中最稳健的表现[1]。谷歌还提到了一个具体的工程案例:在Argon辅助下重写的libgav1视频解码器,运行速度比此前版本快了2.7倍[1]。结合此前引用的法律、自动化和软件工程数据,Argon展现出在法律推理、长上下文视频理解和安全鲁棒性等竞争对手更难复制的领域具有异常强大的能力,即使在纯编码基准测试上仍存在争议。

历史背景

Gemini 4 Argon宣布并发布,初期仅限于Fairwind计划的受信测试者和网络安全防御者,是谷歌在前沿模型竞赛中对OpenAI的GPT-6 Astra和Anthropic的Claude Opus 5.5/Fable的回应。

关键关系图

关键玩家
主题

谷歌Gemini 4 Argon企业级与网络安全模型发布

GO

Google / Google DeepMind

Gemini 4 Argon的开发者与发布方

FA

Fairwind Program

谷歌的受控访问守门人,决定哪些网络安全防御者和机构可提前获得防护机制减弱版的Argon

U.

U.S. government

通过其自愿性发布前安全评估流程参与,并被列为Argon网络安全防御能力的明确目标用户群体

WI

Wiz

早期测试者,使用Argon发现全球医院软件中的关键漏洞,验证了该模型在防御性网络安全场景中的应用价值

OP

OpenAI (GPT-6 Astra)

其模型被Argon直接进行基准测试对比和价格竞争的对手

AN

Anthropic (Claude Opus 5.5)

其模型被Argon直接进行基准测试对比和价格竞争的对手

事实来源

5 条引用
  1. [1] Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic but in limited release
  2. [2] Google's Gemini 4 Argon rolls out to cyber defenders through Fairwind program
  3. [3] Google Gemini 4 Argon
  4. [4] Gemini 4 Argon announcement
  5. [5] Gemini 4 Argon

来源文章

Top 1

THE SIGNAL.

Analysts

“将Argon描述为一款均衡、广泛能力强的前沿模型,而非专为单一基准测试优化的窄域模型。”

Tulsee Doshi (Head of Gemini products, Google DeepMind)
谷歌

“发现Argon在情报指数上与GPT-6 Astra持平,但每项任务成本显著更低,使谷歌重新跻身衡量智力水平前三的实验室行列。”

Artificial Analysis (independent benchmarking firm)
第三方分析师

“指出Argon在公布的18项基准测试中领先或持平13项,其最大优势体现在法律和商业自动化任务上,但在FrontierSWE v2和Terminal-Bench 4.0等部分编码专项测试中落后于竞争对手。”

VentureBeat analysis
行业媒体 / 独立评论
The Crowd

“Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.”

@@GoogleDeepMind29493

“Today we’re introducing Gemini 4 Argon. It delivers frontier performance in complex workflows across real-world software engineering, knowledge work, and cybersecurity defense with an industry-leading 1M token output limit.”

@@Google22921

“One million tokens. On the output side. In a single request, Gemini 4 Argon can generate the length of seven novels. Or the codebase of an entire application. Or a full audit of someone else's infrastructure. Google unveiled it today. Three paragraphs in a blog post. No demo.”

@@0xAI42exe8

“Gemini 4 Argon: our next era of frontier intelligence”

@u/Thistlemanizzle839
Broadcast
Gemini 4 Pro "ARGON" Checkpoint Leaked: 256K Output Limit & Crushing Benchmarks!

Gemini 4 Pro "ARGON" Checkpoint Leaked: 256K Output Limit & Crushing Benchmarks!

Gemini 4 Argon, Google's STRONGEST Model Is Here, This Changes Everything...

Gemini 4 Argon, Google's STRONGEST Model Is Here, This Changes Everything...

HUGE Gemini 4.0 Pro Leaks! Union Alpha 18x Cheaper, DeepSeek Price Crash & Meta Watermelon

HUGE Gemini 4.0 Pro Leaks! Union Alpha 18x Cheaper, DeepSeek Price Crash & Meta Watermelon