Google AI выпустила Gemini 3.5 Transcribe, модель преобразования речи в текст, доступную через две различные конечные точки API: Interactions API для предварительно записанных файлов и Live API для потоковой передачи в реальном времени.

  • Модель демонстрирует среднюю ошибку распознавания слов (WER) на уровне 2,6% для непотоковых данных и 4,0% для потоковых, согласно измерениям Artificial Analysis.
  • Время до получения финальной транскрипции сокращается на 70% по сравнению с предыдущей моделью Chirp 3.
  • Автоматическое определение поддерживает более 85 языков, включая переключение кода в середине предложения.
  • Live API обеспечивает задержку менее секунды, но не поддерживает диаризацию спикеров и пословные временные метки, которые доступны в Interactions API.
  • Умный режим устраняет речевые дефекты, но не может быть использован совместно с временными метками или диаризацией.

Разделение на конечные точки позволяет разработчикам выбирать между потоковой передачей с низкой задержкой для интерфейсов реального времени или расширенными функциями транскрипции для последующей обработки.