Google发布Gemini 3.5 Transcribe
战略概览
- 01.Google于2026年8月26日通过Gemini API以公开预览形式发布了Gemini 3.5 Transcribe,并称其为迄今为止最精准的语音转文本模型。
- 02.该模型以两个独立端点形式发布:gemini-3.5-transcribe通过Interactions API处理预录制音频,gemini-3.5-transcribe-live则通过Live API支持实时流式传输。
- 03.该模型执行“智能转录”——自动删除“呃”“啊”等填充词,修正句子中的自我纠正,并将杂乱的口语输出为格式清晰的文本,而非原始逐字记录。
- 04.该模型已驱动多项消费者功能:Android上Gboard的“Rambler”语音输入功能,以及macOS上Gemini应用(仅限英语),Chrome浏览器的网页文本字段语音输入功能也即将上线。
两个引擎,一个品牌:批量精度与实时速度的权衡
在底层,“Gemini 3.5 Transcribe”实际上是两个独立模型。gemini-3.5-transcribe通过Interactions API处理预录制音频,支持说话人分离、词级时间戳,以及最多1,000个术语的自定义词汇偏置,可处理最长一小时的音频文件(若启用说话人分离或时间戳,则最长30分钟)。而gemini-3.5-transcribe-live则通过Live API进行流式传输,以牺牲上述功能为代价,实现低于200毫秒的中间结果延迟——但会将单次会话限制在10分钟内,并完全跳过说话人分离和词级时间戳[2]。这种拆分方式与产品发布时的定位一致:一个端点专注于录音的准确性,另一个则强调实时响应速度[3]。
基准测试成绩单:2.6%的词错误率及其竞争对手
Google援引Artificial Analysis的独立测试数据称,该模型在预录制音频上的平均词错误率为2.6%,在实时流式音频上为4.0%[2]。在FLEURS多语言基准测试中,非流式模式下词错误率为5.04%,流式模式下为5.50%[2]——有独立分析指出,这些成绩优于Google此前的Chirp 3模型、OpenAI的实时转录模型以及Deepgram的Nova 3。不过评测者提醒,不同基准测试使用的音频条件各异,建议根据实际使用场景进行测试,而非仅依赖表面数据。Google还声称,相比Chirp 3,最终转录时间提升了70%[3][4],预计定价约为每批量分钟0.005美元,每实时分钟0.009美元[2]。
从独立工具到代理基础设施
Google上一代旗舰转录模型Chirp 3是一个独立引擎。而Gemini 3.5 Transcribe的定位截然不同:它被作为代理工作流的底层基础,支持函数调用,可在转录会话中将后续任务(如生成图像或执行网络搜索)交由其他Gemini模型处理[4]。这一重新定位意义重大,因为它将转录功能整合进团队构建语音代理所使用的同一界面中,而非作为事后附加的独立流程。这一战略定位也体现在平台公布的早期集成合作伙伴名单中,涵盖语音代理基础设施(LiveKit、Pipecat、Agora、Vision Agents)、开发工具(LangChain、Vercel)以及垂直应用(IntelliTek Health、Lingopal)。
早期反馈:快速采用,但也存在若干摩擦
发布后一天内,独立开发者已开始发布演示项目——有开发者开源了一个基于该模型构建的类似Wispr Flow的语音输入应用,Google开发者账号随后也展示了社区开发的项目,涵盖语音优先代理和多语言音频工具。社交媒体讨论中最常被提及的亮点是该模型准确处理句中语言切换的能力。Reddit上的反应总体积极,有用户称该模型在一项难度较高的芬兰语数据集上表现优于Whisper和OpenAI的转录模型,但反馈并非完全一致:有用户表示在自家对比测试中,某竞品ASR模型表现更优;另有用户遭遇付费Gemini订阅层级的使用上限;还有人指出,实时/流式端点仍无法区分多个说话人,因为说话人分离功能仅限批量处理。
历史背景
关键关系图
事实来源
[1] Gemini 3.5 Transcribe: Our most precise speech-to-text model yet
[2] Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages
[3] Google announces Gemini 3.5 Transcribe, its most precise speech-to-text model yet
[4] Gemini 3.5 Transcribe positions Google's new speech model as agent infrastructure
来源文章
THE SIGNAL.
“Introducing Gemini Transcribe. Our most precise speech to text model, that can handle over 85+ languages, has smart correction, and custom vocabulary. I vibe coded a Wispr Flow like app powered by the model. Demo + open sourcing below!”
“Gemini Transcribe can accurately turn speech into text across 85+ languages for building intelligent audio experiences. Watch the model seamlessly switch across 4 different languages while accurately transcribing complex numbers.”
“Gemini 3.5 Transcribe is live, and the community is already putting it to work. From voice-first agents to tackling complex, multilingual audio, here are a few of our favorites to inspire your next build.”
“Introducing Gemini 3.5 Transcribe”

How to build with Gemini 3.5 Transcribe

New Gemini 3.5 Transcribe Is WILD!

Forget Everything You Know About Audio AI: Gemini 3.5 Transcribe is Here.