Google发布Gemini 3.5 Transcribe语音转文本模型
TECH

Google发布Gemini 3.5 Transcribe语音转文本模型

29+
Signals

战略概览

  • 01.
    Google于2026年8月26日宣布推出Gemini 3.5 Transcribe,称其为迄今为止最精准的语音转文本模型,现可通过Gemini API、Google AI Studio和Gemini企业代理平台进行公开预览。
  • 02.
    该模型通过两个独立端点提供:用于亚秒级延迟连续流式传输和语音代理的Live API,以及用于带说话人归属和词级时间戳的预录制音频的Interactions(单次)API。
  • 03.
    它可自动检测并转录超过85种语言,包括句中语码转换和区域口音,并支持说话人分离、词级时间戳,以及最多1,000个术语的自定义词汇偏置。
  • 04.
    ‘智能转录’模式可去除填充词和自我修正内容,并自动格式化输出,但无法与时间戳或说话人分离功能同时使用;此外,该模型不通过Batch API、Flex推理或Priority推理提供。

一个模型取代整条流水线

最核心的技术变革是架构层面的,而不仅仅是排行榜上的准确率提升。Gemini 3.5 Transcribe基于大语言模型构建,而非传统的声学模型ASR堆栈,因此它能在一个单次推理中吸收过去需要多个模型串联完成的任务——例如降噪、去除填充词和说话人分离,而无需拼接多个模型。这种架构思路在发布后的社交媒体讨论中直接体现出来,开发者们将此次发布描述为将多模型音频流水线压缩为一次调用,而不仅仅是推出一个更快的转录器。由于该模型基于语言理解而非仅仅匹配声学模式,它在处理结构化内容(如字母数字字符串、电子邮件、电话号码和单位换算)方面比上一代引擎更可靠,并能正确识别句中语言切换(例如,在英语句子中识别德语短语‘one trillion’),而非仅作音译。

Google的环境式听写布局让Wispr Flow面临挑战

最具影响力的商业动向在于竞争格局,而非技术本身。Google通过将高精度、低延迟的转录模型与广泛分发渠道结合——Pixel 11上的Gboard Rambler功能、macOS版Gemini应用,以及即将推出的Chrome集成——正在将‘环境式听写’从一个小众附加功能转变为默认输入模式[3]。一位分析师直言不讳地指出,通过API向所有开发者开放该模型,意味着Wispr Flow(此前少数能提供如此高精度的产品之一)即将面临大量竞争[3]。其战略逻辑很清晰:一个免费嵌入操作系统层级的产品,比一个独立的付费应用更难被竞争,无论谁在某一天拥有略微更优的模型。

宣传数字与实际数字并不一致

Google及其媒体报道引用了第三方评测机构Artificial Analysis的数据,称非流式音频的平均词错误率为2.6%,流式音频为4.0%[1][2]。一些下游报道和创作者评论将其简化为‘99%准确’的说法,但独立评测直接反驳了这一点,明确指出实际宣称的数据是预录制音频2.6%的WER,且不同语言的准确率仍有显著差异。2.5%的错误率与‘几乎完美’的营销话术之间的差距之所以重要,是因为它掩盖了真实限制:Live流式API无法同时启用说话人分离和词级时间戳,而去除填充词的‘智能转录’模式与这两者均不兼容[2]。此外,单次请求最多支持一小时音频(启用说话人分离或时间戳时缩短至三十分钟),实时会话每次最多十分钟,这意味着开发者即使基于听起来很精准的宣传数据,仍需围绕一个相当受限的功能矩阵进行设计[4]

早期采用者已开始发现其局限

社区反馈并未形成统一共识,而是分为两条独立讨论线。在r/Bard的一个讨论中,有用户报告该模型在一组特别困难的芬兰语测试集上优于Whisper和OpenAI的gpt-transcribe,但同一条讨论中的另一位用户表示,在其使用场景中AssemblyAI仍更胜一筹——这提醒我们,‘整体最佳’的说法在特定语言或数据集之外并不成立。另一个r/singularity的讨论帖虽未进行直接对比,但普遍赞扬该模型对非英语口音(包括捷克语和法语使用者)的良好处理能力。这些讨论也揭示了基准测试表中看不到的痛点:一条高赞评论抱怨在Google AI Studio中仅发出约五次转录请求就达到了Gemini Pro的使用上限;考虑将其用于专业实时字幕的开发者质疑,缺乏说话人分离的流式层级是否真的有用;测试自定义词汇的用户发现,模型仍会拆分此前未见过的复合专有名词(一位评论者提到公司名‘Doorknob’被拆开);至少有一位评论者质疑该模型是否能可靠处理两小时的实时录音。这种组合——在特定范围内确实强大的准确率声明,搭配严格的免费层级限制,以及在边缘词汇和长会话支持上的粗糙表现——表明‘令人印象深刻的演示’与‘可靠的生产依赖’之间的差距仍需早期采用者逐步填补,而非由此次发布本身闭合。

历史背景

Chirp 3是Google上一代转录引擎,在一次对比中测得词错误率约为7.32%;Gemini 3.5 Transcribe以报告称比其快70%的最终转录速度取代了它。
Gemini 3.5 Transcribe通过Gemini API、Google AI Studio和Gemini企业代理平台进入公开预览,并同步集成至Pixel 11上的Gboard Rambler和macOS版Gemini应用,Chrome集成已宣布即将推出。

关键关系图

关键玩家
主题

Google发布Gemini 3.5 Transcribe语音转文本模型

GO

Google DeepMind / Google Gemini team

Developer and publisher of Gemini 3.5 Transcribe

WI

Wispr Flow

Competing voice-dictation product facing new competitive pressure from a broadly available, API-accessible transcription model

GO

Google Pixel 11 / Gboard Rambler

Consumer Android product already powered by the model

GE

Gemini app for macOS

Consumer product already using the model for transcription features

GO

Google Chrome

Browser product where the model's dictation feature is announced as coming soon

TH

Third-party developer platforms (LiveKit, Pipecat, Agora, Fishjam, Vercel, Vision Agents)

Pre-integrated partners exposing Gemini 3.5 Transcribe to their own developer bases

AR

Artificial Analysis

Third-party benchmark provider that measured the WER figures Google and others cite

事实来源

4 条引用
  1. [1] Gemini 3.5 Transcribe: Google's Most Precise Speech-to-Text Model
  2. [2] Google's Gemini 3.5 Transcribe Turns Speech to Text in 85 Languages While Auto-Correcting Your Verbal Stumbles
  3. [3] Why Google's Rambler Could Come to Every Device
  4. [4] Gemini 3.5 Transcribe Model Documentation

来源文章

Top 5

THE SIGNAL.

Analysts

通过API向开发者开放Gemini 3.5 Transcribe将加剧语音转文本和听写领域的竞争,并对Wispr Flow等现有产品构成压力。

The Deep View
行业/市场分析师

该模型的表现已优于除Wispr Flow外的所有产品,这正是值得期待的原因。

The Deep View
行业/市场分析师
The Crowd

English ➡️ Spanish ➡️ Hindi ➡️ Mandarin Gemini 3.5 Transcribe can accurately turn speech into text across 85+ languages for building intelligent audio experiences. Watch the model seamlessly switch across 4 different languages while accurately transcribing complex numbers: https://t.co/ls7N8BCcMo

@@googledevs211

Google just replaced whole multi-model audio pipelines with one. Gemini 3.5 Transcribe turns raw speech into clean, formatted text without stitching together separate models for noise removal, filler cleanup, and speaker separation. Every voice product built on a stacked https://t.co/jTKZ0MbebV

@@rryssf15

GOOGLE JUST MADE VOICE TYPING 70% FASTER — AND THAT’S NOT EVEN THE BEST PART. Gemini 3.5 Transcribe doesn’t just write down what you say. It understands what you meant. The numbers: → 2.6% word error rate on recorded audio → 4% word error rate on live streaming → 70% faster than the previous engine

@@JulianGoldieSEO13

Introducing Gemini 3.5 Transcribe

@u/Stoneonn236
Broadcast
How to build with Gemini 3.5 Transcribe

How to build with Gemini 3.5 Transcribe

New Gemini 3.5 Transcribe Is WILD!

New Gemini 3.5 Transcribe Is WILD!

Gemini Transcribe Explained: Is It Really 99% Accurate?

Gemini Transcribe Explained: Is It Really 99% Accurate?