xAI выпустила Grok Voice Transcribe 2.0, модель преобразования речи в текст, которая вдвое точнее версии 1.0 при сохранении той же цены. Модель построена на аудио-фундаментальной модели, лежащей в основе Grok Voice, и использует уникальный набор данных живого зашумленного многоязычного аудио для обработки сложных реальных условий, таких как нестабильные телефонные линии и конкурирующие голоса.
- Занимает первое место по точности среди 32 потоковых моделей на публичном рейтинге Artificial Analysis.
- Улучшает показатель ошибки слов (word error rate) на коротких фразах с 20,6% до 6,8%, что является её крупнейшим многоязычным улучшением.
- Лидирует среди всех протестированных моделей на телекоммуникационном аудио и улучшает производительность на четырех внутренних производственных наборах данных.
- Автоматически определяет язык и обрабатывает переключения языка во время записи за один проход для десятков языков.
Обновление скоро станет стандартным в Speech-to-Text API, а версия 1.0 будет выведена из эксплуатации в ближайшие недели.