SpaceXAI выпустила модель распознавания речи в текст Grok Voice Transcribe 2.0, доступную через хостинговый API, которая, по утверждению компании, обеспечивает вдвое большую точность по сравнению с версией 1.0 при той же стоимости. Модель предназначена для сложных условий записи, таких как зашумленные телефонные линии и перекрывающиеся голоса, и работает как в пакетном режиме, так и в режиме потоковой передачи в реальном времени.
- Заняла первое место среди 32 моделей потоковой передачи в рейтинге Artificial Analysis по бенчмарку AA-WER Streaming.
- Снизила ошибку распознавания слов (WER) с 20,6% до 6,8% на коротких фразах на 19 языках, что примерно на 67% меньше ошибок.
- Поддерживает автоматическое определение языка и переключение языка во время записи для десятков языков.
- Включает такие функции, как диаризация говорящих, пословные временные метки, смещение ключевых терминов и удаление слов-паразитов без дополнительной платы.
- Стоимость составляет $0.10 за час для пакетной транскрипции и $0.20 за час для потоковой передачи.
Atlassian Loom внедрила этот API для транскрипции каждого видео в своем рабочем процессе, отметив более высокую точность по сравнению с предыдущим решением.