Google DeepMind 与 Android 团队推出了 SL2T,这是一款超大规模多语言的手语转文本(SL2T)翻译模型,首次将手语人工智能引入消费级产品。该技术为 Pixel 11 上的 Gboard 和实时转录应用中的手语转文本听写功能提供支持,初期支持美国手语(ASL)到英语的转换。
- SL2T 在超过 50 种手语、逾 10 万小时的数据上进行训练,在 FLEURS-ASL 基准测试中实现了零样本得分 70 BLEURT。
- 该模型直接从 MediaPipe Holistic 跟踪的姿态关键点坐标进行翻译,绕过中间词位(glosses),以捕捉非手动标记和空间结构。
- 隐私通过仅向服务器发送几何坐标来保障,原始视频数据可立即丢弃。
- 该系统解决了实际可用性问题,包括流式传输延迟、幻觉防止以及针对左撇子或单手使用者的性能优化。
此次发布旨在通过使移动设备上的交互更快、更自然,弥合聋人与健听群体之间的沟通鸿沟。开发工作由 AI 手语咨询委员会(AISLAC)指导,以确保负责任地部署并兼顾文化敏感性。