Google DeepMind的SL2T手语转文本模型在Pixel 11上发布
TECH

Google DeepMind的SL2T手语转文本模型在Pixel 11上发布

17+
Signals

战略概览

  • 01.
    SL2T是一款多语言手语转文本模型,于2026年8月12日发布,率先支持美国手语到英语的转换,为Pixel 11上的Gboard和Live Transcribe提供手语转文字听写功能。
  • 02.
    该模型在涵盖50多种手语(约四分之一为ASL)的10万小时以上手语数据上进行训练,利用设备端的MediaPipe Holistic技术追踪面部、身体和双手的130个关键点,仅将这些坐标——从不包括原始视频——发送至设备外进行翻译。
  • 03.
    SL2T直接从姿态关键点序列翻译为文本,跳过了大多数先前手语翻译系统所依赖的中间‘词汇注释’步骤,因为词汇注释无法捕捉非手动标记和空间语法等特征。
  • 04.
    SL2T在FLEURS-ASL基准测试中零样本得分为70 BLEURT(被描述为目前此类基准测试中最强大的手语翻译模型),单手变体得分为74,PRESTO-ASL得分为85,FSboard手指拼写测试中精确匹配率为64%。

深度分析

SL2T的实际工作原理:关键点,而非词汇注释,更非原始视频

SL2T并非像视频通话那样‘看见’手语。设备端模型首先将手语使用者的手部、面部和身体动作转换为几何坐标关键点——MediaPipe Holistic逐帧追踪面部、身体和双手共130个关键点——仅这些坐标(而非原始摄像头画面)被发送至设备外进行翻译[1][2]。原始摄像头画面会立即被丢弃,Google明确将此设计表述为一种隐私保护机制,而非事后补救[1]

更具深远意义的设计选择在于更深层次:SL2T直接从关键点序列翻译为文本,跳过了大多数先前手语翻译系统依赖的中间‘词汇注释’步骤[3]。词汇注释——一种逐字转录约定——无法捕捉手语中丰富的非线性特征,例如非手动标记和空间结构[3]。Google还表示,该模型特别针对左利手和单手手语使用者进行了优化,指出约10%的手语使用者为左利手[4],并包含幻觉预防机制,以避免将非手语动作误识别为输入[5]。这些细节通常不会出现在新闻稿中,却恰恰决定了一个翻译模型是能在日常生活中真正可用,还是仅停留在实验室演示阶段。

真正重要的基准数字:70 BLEURT与‘超越人类翻译员’的说法

Google主推的数字是70——在FLEURS-ASL基准测试零样本设置下的BLEURT得分,该公司及独立报道均称这是迄今为止在该基准上发布的最强大的手语翻译结果[1][6]。在其他内部基准测试中,SL2T在单手手语变体上得分为74 BLEURT,在PRESTO-ASL上得分为85 BLEURT,FSboard手指拼写测试中精确匹配率为64%[1]

使70这一数字超越普通增量进步的是一个并未出现在Google自身材料中、而是在社区讨论中浮现的对比:此前广泛引用的最佳得分为45,而人类翻译员基线得分约为64.6。在此同一基准测试中,SL2T的70分意味着其表现已超过普通人类翻译员——这对任何AI翻译系统而言都是极为罕见的宣称。这一说法需加说明:它源自第三方对基准测试的分析,而非Google官方声明;且BLEURT仅是单一学术基准上的单一指标,不能保证模型在不同方言、光照条件或陌生使用者情况下的实际表现。Google自身列出的局限性也坦率承认了模型的不足之处:最长支持60秒的片段、仅支持单人手语、在低光或极端摄像头角度下准确率下降,且未使用18岁以下使用者的训练数据[1]。该公司还明确划定了SL2T绝不应使用的场景——医疗咨询、法律程序、警方互动、课堂教学、求职面试和政府福利认定均被明确禁止[1]——这种异常直白的承认表明,即使在基准测试中领先,也不等于获得了高风险场景部署的许可。

首先是消费产品,而非研究演示:与聋人社区合作内置于键盘中

与大多数AI模型发布不同,SL2T并未作为API或研究论文发布——而是直接内置于键盘中。由于该功能存在于Gboard和Live Transcribe中,聋人手语使用者无需打字,只需面对手机摄像头做手语,即可进行网页搜索、起草消息或文档,或在Live Transcribe对话中用手语回复,而非向听力正常者打字回复[3]。这与发布独立翻译应用的分发策略有本质区别:它将这一能力嵌入到Pixel 11用户日常使用键盘的每一个场景中。

其开发过程也格外明确地指出了谁参与了塑造。Google表示,该项目由一名聋人员工提出,并成立了AI手语咨询委员会(AISLAC),汇集了聋人组织和手语专家,他们正与Google共同撰写一份关于模型能力与局限性的报告[4]。这一治理结构直接映射到产品的防护机制上:明确禁止在医疗、法律、执法、课堂、求职面试和福利认定等场景中使用[1],这显然是那些深刻理解误译可能在这些场景中造成伤害的人所制定的规则。权衡的代价是覆盖范围——发布时,SL2T仅支持ASL转英语,且仅限于Pixel 11,目前尚未覆盖全球约200种手语及所有非Pixel设备[3]

几乎人人称赞的罕见AI发布——以及它重新点燃的战略争论

AI产品发布很少能毫无争议,这正是SL2T受到关注的原因之一。Reddit上r/singularity板块的热门帖子获得了约2,200个赞和144条评论,主流观点认为这是少数几个真正令人感到欣慰的AI故事——评论者明确将DeepMind追求‘酷炫且新颖的科学’(天气预报、蛋白质折叠,如今是手语)与行业内其他公司追逐聊天机器人基准的行为形成对比。在X平台上,DeepMind自身的公告和独立AI评论员均收到庆祝性回复,而非通常伴随大型科技公司AI发布而来的怀疑态度。出现的少数反对意见也较为局限:一个子讨论需解释ASL是一种拥有自身语法的独立语言,因此该功能是为英语读写能力较低的人群设计的翻译工具,而非对能打字者而言多余的便利功能;另一评论者则质疑Google长期维护该功能的承诺,呼应了产品疲劳的常见模式。

这种善意直接推动了第二轮更深入的分析性争论:SL2T是否验证了DeepMind专注于构建针对复杂科学与社会问题的专用、窄域模型(天气预测、蛋白质结构、如今的手语)的战略,从而与行业聚焦于扩展通用模型的主流形成鲜明对比。Reddit上关于这一点的争论并未达成共识,但一个键盘功能竟能引发对公司战略的讨论,本身就说明AI社区如今多么热衷于将每一次发布解读为某种宏大战略理论的证据。

THE SIGNAL.

Analysts
The Crowd

SL2T is our breakthrough sign language-to-text model powering new features for Deaf and hard of hearing users on @Android. Starting with American Sign Language-to-English on Pixel 11, people can sign directly into Gboard and Live Transcribe instead of typing.

@@GoogleDeepMind1124

Google DeepMind is doing some crazy work. This is so good and is going to help so many people. They just launched SL2T (Sign Language to Text), an AI model that translates sign language directly into text. Most spoken language dictation tools rely on audio to text, but sign...

@@ai_for_success168

We built SL2T with the Deaf community - guided by Deaf Googlers and our AI Sign Language Advisory Committee. Bringing ASL input to phones is just the beginning and we're working to expand this technology to more sign languages and applications. Find out more →

@@GoogleDeepMind91

DeepMind just released SL2T, sign language-to-text model, deaf users can now sign into their phones instead of typing, developed with heavy input from the Deaf community

@u/TorturedPoet302200
Broadcast
Google DeepMind Just Destroyed The Sign Language Barrier

Google DeepMind Just Destroyed The Sign Language Barrier

[8/12 15:00] Made by Google 2026 - Pixel 11, Gemini, and the SL2T sign language model / CodeRabbit raises $143M

[8/12 15:00] Made by Google 2026 - Pixel 11, Gemini, and the SL2T sign language model / CodeRabbit raises $143M

Pixel 11とGemini Intelligence全面刷新/Google手話AI/Suno×BMG提携ほか【Creative AI Digest No.149 2026.08.13】

Pixel 11とGemini Intelligence全面刷新/Google手話AI/Suno×BMG提携ほか【Creative AI Digest No.149 2026.08.13】