Google сообщает, что его технологии теперь поддерживают более 300 языков для более чем 7 миллиардов человек, представляя новые инструменты для улучшения понимания речи, сбора данных для недостаточно представленных языков и обеспечения доступности.
- Gemini 3.5 Live Translate обеспечивает перевод устной речи в реальном времени на 70 языках и для более чем 2000 пар языков, захватывая кодовое переключение и эмоциональные нюансы.
- Универсальная модель речи (Universal Speech Model), обученная на 12 миллионах часов аудио, использует кроссоязычное трансферное обучение для достижения цели охвата 1000 наиболее распространённых языков мира.
- Партнёрства по открытым данным, включая WAXAL, Project Vaani и Amplify Initiative, собрали обширные речевые данные для языков стран Африки к югу от Сахары и Индии.
- TranslateGemma предоставляет лёгкие модели перевода с открытым исходным кодом, которые эффективно работают на устройстве без подключения к интернету.
- Система перевода жестового языка в текст (SL2T) обеспечивает диктовку «жест-в-текст» в Gboard и Live Transcribe для более чем 50 жестовых языков, начиная с американского жестового языка.
Эти инновации призваны сократить цифровое неравенство за счёт обеспечения офлайн-доступности языковых технологий, поддержки диалектов с низким уровнем ресурсов и сохранения культурных нюансов в системах ИИ.