Google发布Gemini 3.5 Transcribe,一款基于大语言模型的语音转文本模型
TECH

Google发布Gemini 3.5 Transcribe,一款基于大语言模型的语音转文本模型

29+
Signals

战略概览

  • 01.
    Google于2026年8月26日发布了Gemini 3.5 Transcribe,这是一款语音转文本模型,可自动检测并转录85种以上语言,同时去除填充词、处理自我修正,并捕捉说话者的意图。
  • 02.
    该模型以两个独立端点形式发布:通过Live API提供的实时流式模型(gemini-3.5-transcribe-live,4.0% WER),以及通过Interactions API提供的批量模型(gemini-3.5-transcribe,2.6% WER,支持说话人分离和词级时间戳)。
  • 03.
    该模型目前正通过Pixel手机的Rambler功能和macOS版Gemini应用推出,Chrome、Search Live、Gemini Live、Docs、Keep、Gmail及开发者API即将上线。
  • 04.
    它还通过Google AI Studio、Google Antigravity以及面向企业的Gemini Enterprise Agent Platform提供公开预览。

会倾听而非仅听见的大语言模型:Gemini 3.5 Transcribe背后的架构变革

Gemini 3.5 Transcribe并非只是换名包装的声学解码器——它基于Gemini大语言模型构建,而非专用声学识别器,并且运行在开发者已用于文本和多模态任务的同一Gemini API接口中。这一区别至关重要,因为大语言模型不只是将声音映射为字符,而是对说话者的真实意图进行推理。Google自己的材料描述该模型能去除填充词、纠正口误并自动格式化文本,而非逐音节转录所听到的内容[2]

这种实际效果最明显地体现在模型如何处理自我修正的言语上:由于它建模的是意图而非纯粹声学信号,一个被放弃的错误开头可以被合并为说话者最终修正后的含义,而不是原样保留两部分。发布演示清晰展示了这一点:模型在语音中途正确自我修正了一个电子邮件地址,并根据上下文而非固定模板将电话号码解析为正确的区域格式——例如10位的美国号码或8位的新加坡号码。正是这种以语言优先的设计,使得Gemini 3.5 Transcribe支持最多1,000个自定义术语的词汇偏置——包括姓名、术语、品牌词等纯声学模型容易误听的词汇——因为它将识别视为一种可进行语言偏置的任务,而不仅仅是一个信号处理问题[1]。这确实偏离了Chirp 3的声学建模传统,也正是为什么4.0%流式和2.6%批量的标称错误率需要打上星号的原因:它们衡量的是恢复的意义,而不仅仅是原始音素准确性[1]

清理的代价:当智能模式抹去语义

同样的以意图优先的设计也是Gemini 3.5 Transcribe最大的争议点。该模型提供两种输出模式:默认的‘逐字’(Verbatim)模式,完整保留填充词、重复和错误开头;以及‘智能’(Smart)模式,去除不流畅表达并应用结构化格式——但明确不支持词级时间戳或说话人分离[1]。选择智能模式是以原始保真度换取可读性,而这种权衡并非无成本。

测试该模型的开发者直接指出了其中风险。一位Hacker News评论者Crystalin警告称,智能模式的清理可能会将句子‘简化’成改变其原意的形式,举例说明像‘我犹豫要不要检查它,我本应核实’这样的自我修正句可能被压缩为‘我本应核实’,从而丢失了‘犹豫’这一关键信息[3]。另一位评论者film42进一步指出,该模型仍然‘存在与Chirp相同的幻觉问题’,他们的团队已回退使用Whisper确保时间戳精度,并仅用Gemini Flash进行后续校正[3]。Reddit用户在独立评估这一权衡时也描述了类似情况:在那些犹豫或自我修正是话语核心意义的情况下,智能模式实际上剥离了重要信号——相同担忧在两个不同社区中自发浮现,且未受Google自身宣传材料影响。

Gemini vs Whisper、Deepgram、ElevenLabs:一场没有共识赢家的基准之战

Google此次发布附带了一组异常直接的对比数据。在FLEURS多语言基准测试中,Gemini 3.5 Transcribe在流式模式下WER为5.50%,批量模式下为5.04%[1],相比之下,Google自家前代产品Chirp 3为7.32%,OpenAI的GPT Live Transcribe为8.97%,ElevenLabs Scribe v2 Realtime为9.70%,Deepgram Nova-3为15.77%[3]。在价格方面,Google将批量端点定价约为每分钟0.005美元(综合计价),实时端点约为每分钟0.009美元(综合计价)[4]

开发者并未全盘接受这些比较。一位Hacker News评论者Void_计算了ElevenLabs Scribe约每小时0.22美元的费率与Gemini约每小时0.12美元的费率后,称‘如果准确率相当,这是笔划算交易’——但另一位评论者dbbk则断然反对,称Gemini 3.5 Transcribe‘仍然比ElevenLabs Scribe更贵且性能更差’[3]。Reddit上的分歧持续存在:一位用户在测试芬兰语数据集时表示该模型优于Whisper和OpenAI的转录模型,而另一位用户在与AssemblyAI的直接对比后得出结论‘assembly赢了’,但未说明具体任务细节。就连持同情态度的独立声音也在关键数字上有所保留:X平台上的@JulianGoldieSEO强调了2.6%的批量WER数据——即每100个词大约有97至98个正确——随后补充道‘准确性只是故事的一半’,但未说明另一半是什么。这三个讨论线程中的模式一致:聚合基准平均值无法预测该模型在任何特定团队的语言、口音或音频条件下的表现,购买者发现不同数据集之间的实际差异显著。

从开发者API到Google每个角落:发布的豪赌与命名玩笑

与典型的模型卡片发布不同,Gemini 3.5 Transcribe一推出就已集成进消费产品中。它现在驱动着Pixel设备Gboard上的Rambler语音输入功能以及macOS版Gemini应用,Chrome网页语音输入、Search Live、Gemini Live、Docs、Keep和Gmail均列于即将上线名单中[5][6]。该模型也已通过Google AI Studio、Google Antigravity以及面向企业的Gemini Enterprise Agent Platform开放公测,将同一转录引擎同时呈现给消费者、开发者和企业客户[7]

这种广泛部署正是其战略所在:Gemini 3.5 Transcribe明确旨在取代Chirp 3——这款声学转录模型是Google大约十八个月前通过Vertex AI推出的[8]——将语音识别整合进开发者用于其他所有任务的同一Gemini API中,不再维护独立产品线。发布名称本身甚至成为网络上的一个小插曲——r/singularity社区成员延续了关于Google版本编号系统越来越难追踪的玩笑,将这种命名节奏视为Gemini系列快速迭代的又一迹象。

历史背景

Google发布《Google USM:超越百种语言的自动语音识别扩展》研究论文,为Chirp模型系列奠定基础。
宣布推出Chirp 3,新增转录、高清文本转语音和即时自定义语音功能,支持85种以上语言和地区。
Google以公开预览形式推出Gemini 3.5 Transcribe,定位其取代Chirp 3成为旗舰转录模型,并将语音转文本统一至Gemini API。

关键关系图

关键玩家
主题

Google发布Gemini 3.5 Transcribe,一款基于大语言模型的语音转文本模型

事实来源

8 条引用
  1. [1] Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages
  2. [2] Google's Gemini 3.5 Transcribe turns speech to text in 85+ languages while auto-correcting your verbal stumbles
  3. [3] Gemini 3.5 Transcribe review: accuracy, pricing, and developer reactions
  4. [4] Gemini 3.5 Transcribe Review: Accuracy, Price, Is It Worth It?
  5. [5] Google's latest Gemini transcription model can turn ramblings into structured text
  6. [6] Google announces Gemini 3.5 Transcribe
  7. [7] Google launches Gemini 3.5 Transcribe with smarter speech-to-text and 85-language support
  8. [8] Google adds its HD voice model, Chirp 3, to its Vertex AI platform

来源文章

Top 5

THE SIGNAL.

Analysts

称Gemini 3.5 Transcribe是他们在准确性、延迟和格式化方面用过的最佳语音输入模型,现已作为日常主要语音输入模型使用。

k9294
Hacker News评论者,语音输入工具用户

警告智能模式的清理可能将自我修正的言语‘简化’并改变其原意,引用了一个例子:带有犹豫的承认被压缩为更平淡的陈述。

Crystalin
Hacker News评论者

表示该模型仍存在与Chirp相同的幻觉问题,并报告其团队已回退使用Whisper确保时间戳精度,再辅以Gemini Flash进行校正。

film42
评估语音转录流程的开发者

计算出Gemini 3.5 Transcribe每小时音频成本低于ElevenLabs Scribe,称若准确性达标,这是一笔划算交易。

Void_
Hacker News评论者,成本比较

指出即使实验性功能也无法支持超过三人的实时说话人分离,相比Soniox和Deepgram等能良好处理此功能的竞品存在差距。

satvikpendem
Hacker News评论者

不同意更乐观的定价观点,认为Gemini 3.5 Transcribe仍比ElevenLabs Scribe更贵且性能更差。

dbbk
Hacker News评论者
The Crowd

Earlier today we introduced Gemini 3.5 Transcribe, our latest text-to-speech model. But, what does this actually mean for your projects? We built this app in @GoogleAIStudio to demonstrate just how much smarter 3.5 Transcribe is. When streaming live audio simultaneously through...

@@googledevs428

Gemini 3.5 Transcribe is our most precise speech-to-text model yet, designed for intelligent voice interactions. Whether you're building real-time, voice-first interfaces, or transcribing multi-speaker recordings, Gemini 3.5 Transcribe adapts to your needs by: > Transcribing...

@@googledevs238

Gemini 3.5 Transcribe just hit a 2.6% word error rate on recorded audio. That means roughly 97-98 words correct out of every 100. But accuracy is only half the story.

@@JulianGoldieSEO10

Introducing Gemini 3.5 Transcribe

@u/Stoneonn239
Broadcast
How to build with Gemini 3.5 Transcribe

How to build with Gemini 3.5 Transcribe

Build voice-first apps with Gemini 3.5 Transcribe

Build voice-first apps with Gemini 3.5 Transcribe

New Gemini 3.5 Transcribe Is WILD!

New Gemini 3.5 Transcribe Is WILD!