Google AI выпустила Gemini 3.5 Transcribe, модель преобразования речи в текст, доступную через две различные конечные точки API: Interactions API для предварительно записанных файлов и Live API для потоковой передачи в реальном времени.
- Модель демонстрирует среднюю ошибку распознавания слов (WER) на уровне 2,6% для непотоковых данных и 4,0% для потоковых, согласно измерениям Artificial Analysis.
- Время до получения финальной транскрипции сокращается на 70% по сравнению с предыдущей моделью Chirp 3.
- Автоматическое определение поддерживает более 85 языков, включая переключение кода в середине предложения.
- Live API обеспечивает задержку менее секунды, но не поддерживает диаризацию спикеров и пословные временные метки, которые доступны в Interactions API.
- Умный режим устраняет речевые дефекты, но не может быть использован совместно с временными метками или диаризацией.
Разделение на конечные точки позволяет разработчикам выбирать между потоковой передачей с низкой задержкой для интерфейсов реального времени или расширенными функциями транскрипции для последующей обработки.