谷歌SL2T将手语AI引入Pixel手机
在无障碍技术的重要一步中,谷歌DeepMind推出了SL2T,一种多语言手语转文本模型,并将其集成到Pixel 11智能手机系统中。这标志着手语AI首次嵌入主流消费电子产品,为聋人和听力障碍用户开辟了新的可能性。
该模型最初与Gboard键盘和Live Transcribe集成,使用户能够通过在手机摄像头前做手语手势来撰写消息、搜索网页并与Gemini互动。这取代了传统的键盘输入,提供了一种更自然、更直观的交流方式。
SL2T在包含超过10万小时手语视频的广泛数据集上训练,涵盖超过50种手语。其中约四分之一的数据来自美国手语(ASL)数据集。跨语言联合训练方法允许模型学习不同手语中的常见动作模式,并在FLEURS-ASL评估基准上创下了手语转录模型的新纪录。
与依赖固定词汇标签的传统解决方案不同,SL2T直接解释人类动作以生成文本。它还处理非手部语义信息,如面部表情、身体在空间中的位置和唇部动作,从而更全面地理解手语者的意图。
隐私是一个关键考虑因素。手机端的MediaPipe Holistic实时跟踪手、脸和躯干上的130个关键点,仅传输运动坐标。原始视频会立即删除,永远不会上传到云端,确保用户隐私。
目前,该功能仅支持美国手语到英语的翻译。谷歌计划未来扩展到更多手语和Android设备,使这项技术惠及更广泛的受众。
DeepMind此前于2025年5月开源了手语翻译模型SignGemma,为SL2T提供了算法基础。此外,其WaveNet、Euphonia和Live Transcribe无障碍技术在多模态音频和视觉交互方面积累了经验。
随着谷歌、科大讯飞、华为和苹果继续投资于无障碍技术,AI驱动的交互正在从研究验证加速转向消费级产品。这一发展不仅展示了技术进步,也强调了数字时代包容性设计的重要性。
关键要点
- 首创:SL2T是首个集成到消费级智能手机中的手语AI。
- 多语言训练:在50多种手语的10万小时以上数据上训练。
- 高级理解:处理面部表情、身体位置和唇部动作,超越手势。
- 注重隐私:设备端处理,原始视频立即删除。
- 未来扩展:最初支持ASL到英语,计划支持更多语言和设备。