会倾听而非仅听见的大语言模型:Gemini 3.5 Transcribe背后的架构变革
Gemini 3.5 Transcribe并非只是换名包装的声学解码器——它基于Gemini大语言模型构建,而非专用声学识别器,并且运行在开发者已用于文本和多模态任务的同一Gemini API接口中。这一区别至关重要,因为大语言模型不只是将声音映射为字符,而是对说话者的真实意图进行推理。Google自己的材料描述该模型能去除填充词、纠正口误并自动格式化文本,而非逐音节转录所听到的内容[2]。
这种实际效果最明显地体现在模型如何处理自我修正的言语上:由于它建模的是意图而非纯粹声学信号,一个被放弃的错误开头可以被合并为说话者最终修正后的含义,而不是原样保留两部分。发布演示清晰展示了这一点:模型在语音中途正确自我修正了一个电子邮件地址,并根据上下文而非固定模板将电话号码解析为正确的区域格式——例如10位的美国号码或8位的新加坡号码。正是这种以语言优先的设计,使得Gemini 3.5 Transcribe支持最多1,000个自定义术语的词汇偏置——包括姓名、术语、品牌词等纯声学模型容易误听的词汇——因为它将识别视为一种可进行语言偏置的任务,而不仅仅是一个信号处理问题[1]。这确实偏离了Chirp 3的声学建模传统,也正是为什么4.0%流式和2.6%批量的标称错误率需要打上星号的原因:它们衡量的是恢复的意义,而不仅仅是原始音素准确性[1]。


