Google宣布其技术现支持超过70亿人的300多种语言,并推出新工具以改善语音理解、为代表性不足的语言收集数据以及提升无障碍功能。
- Gemini 3.5 Live Translate支持70种语言和2,000多个语言对的实时口语翻译,能够捕捉语码转换和情感线索。
- Universal Speech Model基于1,200万小时的音频训练,利用跨语言迁移学习,旨在覆盖全球使用人数最多的1,000种语言。
- 包括WAXAL、Project Vaani和Amplify Initiative在内的开放数据合作伙伴关系已为撒哈拉以南非洲和印度语言收集了大量语音数据。
- TranslateGemma提供轻量级开源翻译模型,可在无网络连接的情况下高效地在设备端运行。
- Sign Language-to-Text (SL2T) 为Gboard和Live Transcribe中的手语到文本听写功能提供支持,覆盖50多种手语,首先从美国手语开始。
这些创新旨在通过使语言技术可离线使用、支持低资源方言以及确保AI系统保留文化细微差别来弥合数字鸿沟。