Google的Gemini 3.8 Flash发布
TECH

Google的Gemini 3.8 Flash发布

39+
Signals

战略概览

  • 01.
    Google于2026年9月2日推出了Gemini 3.8 Flash,距离Gemini 3.7 Flash发布仅三周时间,这是其约六周内的第三次Flash系列发布。Google称其为在与3.7版本相同速度和价格下,推理与编码能力最强的模型。
  • 02.
    除了通用模型外,Google还推出了Gemini 3.8 Flash Cyber,这是一种专为自主发现和修复漏洞而设计的变体,仅通过新的“Fairwind计划”向经过审核的政府和基础设施合作伙伴提供。
  • 03.
    Google还在整个Flash系列中推出了代理式视频理解功能,在提升准确性的同时,将长视频分析的token使用量最多减少了88%。
  • 04.
    Gemini 3.8 Flash的定价为每百万输入token 0.75美元,每百万输出token 3.75美元,该价格将持续至2026年底——约为Claude Opus 5和GPT-5.6 Sol价格的5到7倍便宜,同时在多个代理基准测试中达到或超越两者表现。

六周发布节奏:为何Google持续推出Flash系列

Gemini 3.8 Flash是Google在约六周内推出的第三款Flash系列模型,此前分别为7月21日发布的3.6 Flash和8月13日发布的3.7 Flash [8]。Google并非每次训练一个全新的基础模型,而是通过算法迭代实现升级——3.7 Flash被明确描述为一次优化而非全新基础模型,而3.8 Flash在保持与前代相同价格和速度的同时,要求模型“更努力工作”:在复杂请求中运行更多内部推理步骤,并迭代调用工具 [1][2]。内部工程师在Google的Jetski开发者平台上测试预发布版本时,据报道在编码任务中更偏好该模型而非Anthropic的Claude Opus,但外部报道谨慎指出,单次发布不太可能让Google重回模型竞赛的最顶端 [5]。发布节奏本身或许才是真正的重点:六周内三次发布,是对Claude Opus 5和GPT-5.6 Sol带来的竞争压力的直接回应,而非单一科学突破 [5]

Flash Cyber的防御优先策略

更引人注目的发布是Gemini 3.8 Flash Cyber,这是一款专为自主发现和修复漏洞而调优的专用模型。Google表示,该模型在修复能力上被刻意设计得强于利用能力,从而让防御方获得优势,而非为潜在攻击者提供武器 [3]。该模型在CWE-Bench上的pass@1得分为47.2%,几乎追平某未具名领先前沿模型的47.8% [1]。Google自己的云漏洞研究团队利用该模型在不到两小时内发现了一个关键基础性漏洞,而这项任务通常需要数月时间 [3]。第三方验证来自Wiz,该公司独立使用其内部渗透测试套件对Flash Cyber进行基准测试,发现其召回率显著更高,且成本仅为领先前沿模型的一小部分 [1]。由于此类漏洞发现能力极强的模型同样可能被武器化,Google并未将其开放至通用API,而是通过新的Fairwind计划进行限制,将Flash Cyber与Google的CodeMender补丁生成工具结合,仅向经过审核的政府、关键基础设施运营商(医疗、电信、能源、金融)以及广泛使用的软件平台维护者开放 [4][9]。补丁在组织自身的安全云环境中生成,而非通过外部暴露代码实现 [4]

基准测试与质疑:批判性解读数据

从纸面数据看,Gemini 3.8 Flash似乎实现了真正飞跃:在Terminal-bench 2.1(89.4% vs 89.1%)和CharXiv Reasoning(86.2% vs 83.7%)上略胜Claude Opus 5,在Vals Finance Agent v2和Harvey Legal Agent基准测试中击败Opus 5和GPT-5.6 Sol,且每token成本仅为Opus 5和Sol的五分之一到七分之一 [6]。但Google之外的反响比成绩单显示的更为怀疑。一个反复出现的批评是,一项关键代理编码基准测试图表仅在比较发布前不久才公布,引发模型被专门针对该测试进行调优的指控——即所谓的“benchmaxxing”——而非展示广泛能力提升;同时也有担忧认为3.8 Flash可能只是比3.7在每项任务中消耗更多token,从而虚增得分。第二个较隐性的矛盾在于模型在实际使用中的表现差异:多名用户报告称,面向消费者的Gemini应用和Flash-Lite界面仍不可靠,容易产生幻觉,除非手动开启“Extended”思考模式,而同一底层模型在Google的Antigravity IDE中表现明显更佳——这表明相同的模型权重在不同访问场景下可能感觉像是两个不同的产品。

便宜的模型,而非榜首模型:Google的真实战略

比任何单一基准测试更值得关注的,或许是Google更广泛的战略:如果廉价模型、庞大的分发渠道以及现有的广告业务能带来比单纯追逐能力的独立实验室更优的单位经济效益,它就不必赢得每一场前沿模型的头条。整个行业的token价格已从夏季峰值大幅回落,而Gemini 3.8 Flash每百万token 0.75美元/3.75美元的定价——承诺维持至2026年底 [1]——进一步加剧了价格战,比Claude Opus 5的5美元/25美元费率低约6.7倍,比GPT-5.6 Sol的4美元/20美元费率低约5.3倍 [6]。市场将这一举措解读为具有竞争意义而非变革性:Alphabet股价在发布前的盘后交易中仅小幅上涨0.6%至0.7%,华尔街普遍维持“强力买入”评级,且市场仍预期股价有进一步上涨空间 [5]。值得注意的是,这一定价与发布节奏策略正在推进的同时,Google更雄心勃勃的路线图项目却在滞后:截至此次发布,Gemini 3.5 Pro仍未推出,尽管Google高层此前曾承诺,尽管公司仍坚称Gemini 4的预训练工作按计划在本年度内进行——这提醒人们,Flash系列的快速迭代在一定程度上是在弥补其产品线真正前沿端进展较慢的不足。

历史背景

Gemini 3 Flash首次推出,成为当前Flash系列的基础。
Gemini 3.6 Flash作为2026年7月发布浪潮的一部分推出,同期还包括Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。
Gemini 3.7 Flash在3.6 Flash发布三周后推出,作为一次算法优化(而非全新基础模型),在编码、代理工作流和文档理解方面有所提升,成本为3.6 Flash的一半。
Google为Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite引入了代理式视频理解功能,将长视频token使用量最多减少88%,成本最多降低66%。
Gemini 3.8 Flash和Gemini 3.8 Flash Cyber在3.7 Flash发布三周后推出,同时发布了新的Fairwind计划,供政府和基础设施网络安全防御访问。

关键关系图

关键玩家
主题

Google的Gemini 3.8 Flash发布

GO

Google DeepMind

Gemini 3.8 Flash和3.8 Flash Cyber的开发者;发布声明由Tulsee Doshi(产品管理高级总监)和Raluca Ada Popa(Gemini安全负责人)联合撰写。

GO

Google Chrome Security team

Flash Cyber的早期内部采用者,报告其正确漏洞补丁数量比更大商业模型高出2.6倍——作为该模型真实世界验证的亮点。

GO

Google Cloud Vulnerability Research team

使用Flash Cyber在不到两小时内发现一个关键基础性漏洞,而这项任务通常需要数月时间。

WI

Wiz

独立安全公司,使用其内部渗透测试套件对Flash Cyber进行基准测试,发现其召回率更高,且成本仅为领先前沿模型的一小部分——为Google的效率主张提供了第三方验证。

AN

Anthropic (Claude Opus 5)

主要基准测试竞争对手;Gemini 3.8 Flash的定价比Opus 5便宜约6至7倍,同时在多个代理基准测试中达到或接近其表现。

OP

OpenAI (GPT-5.6 Sol)

竞争性前沿实验室,其模型在多项引用的基准测试中落后于Gemini 3.8 Flash,且定价更高。

事实来源

9 条引用
  1. [1] Gemini 3.8 Flash and Gemini 3.8 Flash Cyber: Google's latest Flash model launch
  2. [2] Google rolls out Gemini 3.8 Flash, its third Flash update in three months
  3. [3] Gemini 3.8 Flash Cyber: Google's new model for finding and fixing vulnerabilities
  4. [4] Introducing the Fairwind Program for cyber defense
  5. [5] GOOGL stock gains as Google readies 3.8 Flash model to compete in AI coding race
  6. [6] Google releases Gemini 3.8 Flash, beats Opus 5, GPT 5.6 Sol on some benchmarks at a fraction of the price
  7. [7] Google's agentic video understanding cuts token usage by up to 88% in AI Studio
  8. [8] Google launches Gemini 3.7 Flash three weeks after 3.6 Flash
  9. [9] Google unveils its most intelligent Gemini 3.8 Flash model, announces Fairwind Program

来源文章

Top 5

THE SIGNAL.

Analysts

联合撰写了官方发布声明,将3.8 Flash描述为Google在软件工程、代理任务和多步推理方面最智能的主力模型。

Tulsee Doshi
Google DeepMind产品管理高级总监

报道称,工程师在Google Jetski平台上进行的头对头编码测试中更偏好预发布版的3.8 Flash模型而非Anthropic的Claude Opus,但警告称仅凭此次发布尚不足以立即将Google带回AI模型竞赛的顶端。

Wall Street Journal (via secondary reporting)
财经媒体,援引未具名的Google员工
The Crowd

Introducing Gemini 3.8, our best reasoning & coding model yet. By leveraging long-running agentic loops, we're building on the momentum of 3.7 Flash from just three weeks ago to release two new 3.8 variants: Meet Gemini 3.8 Flash and Gemini 3.8 Flash Cyber 🧵

@@Google7073

Today we're launching Gemini 3.8 Flash Cyber and Gemini 3.8 Flash. ⚡️🛡️ 3.8 Flash Cyber is our most capable cybersecurity model for finding and fixing vulnerabilities. It sits on the Pareto Frontier on CWE-Bench for patching. Available to trusted defenders through our new [program]

@@koraykv573

3.8 Flash is the same price as 3.7, is ~the same speed, and is available via the Gemini API, in AI Studio, Antigravity, Gemini App, and more! Read more: [blog link] So incredible to see the progress and hard work from the team. Pushing hard to be at the frontier.

@@OfficialLoganK420

3.8 Flash coming out today

@u/DigSignificant1419722
Broadcast
Google's new coding model

Google's new coding model

Gemini 3.8 Flash - Benchmark and Pricing | Beats Claude Opus 5?

Gemini 3.8 Flash - Benchmark and Pricing | Beats Claude Opus 5?

Gemini 3.8 Flash Releases Today & Claude Fable 5.1 + Mythos 5.1 Just Dropped

Gemini 3.8 Flash Releases Today & Claude Fable 5.1 + Mythos 5.1 Just Dropped