SL2T的实际工作原理:关键点,而非词汇注释,更非原始视频
SL2T并非像视频通话那样‘看见’手语。设备端模型首先将手语使用者的手部、面部和身体动作转换为几何坐标关键点——MediaPipe Holistic逐帧追踪面部、身体和双手共130个关键点——仅这些坐标(而非原始摄像头画面)被发送至设备外进行翻译[1][2]。原始摄像头画面会立即被丢弃,Google明确将此设计表述为一种隐私保护机制,而非事后补救[1]。
更具深远意义的设计选择在于更深层次:SL2T直接从关键点序列翻译为文本,跳过了大多数先前手语翻译系统依赖的中间‘词汇注释’步骤[3]。词汇注释——一种逐字转录约定——无法捕捉手语中丰富的非线性特征,例如非手动标记和空间结构[3]。Google还表示,该模型特别针对左利手和单手手语使用者进行了优化,指出约10%的手语使用者为左利手[4],并包含幻觉预防机制,以避免将非手语动作误识别为输入[5]。这些细节通常不会出现在新闻稿中,却恰恰决定了一个翻译模型是能在日常生活中真正可用,还是仅停留在实验室演示阶段。

![[8/12 15:00] Made by Google 2026 - Pixel 11, Gemini, and the SL2T sign language model / CodeRabbit raises $143M](https://img.youtube.com/vi/lB5Gej3Yf4c/mqdefault.jpg)
