Google выпустила модель преобразования речи в текст Gemini 3.5 Transcribe, предназначенную для интеллектуальных голосовых взаимодействий: она преобразует сырой аудио в точный и отполированный текст, справляясь с фоновым шумом и речевыми искажениями.

  • Достигает средней ошибки распознавания слов (WER) на уровне 4,0% для потоковой передачи и 2,6% для непотоковых сценариев использования по данным Artificial Analysis.
  • Улучшает время до получения финальной транскрипции на 70% по сравнению с предыдущей моделью Chirp 3.
  • Поддерживает более 85 языков с автоматическим определением и обрабатывает пользовательский словарь для специализированной терминологии.
  • Предоставляет потоковую передачу в реальном времени через Live API и обработку предварительно записанного аудио через Interactions API.
  • Позволяет вызывать функции для делегирования задач, таких как генерация изображений, другим моделям Gemini.

Модель доступна в публичной предварительной версии через Gemini API, Google AI Studio и платформу Gemini Enterprise Agent Platform.