Meta Superintelligence Labs выпустила Muse Voice Transcribe — единую авторегрессионную модель, выполняющую потоковую автоматическую распознавание речи (ASR), диаризацию говорящих для 20+ участников и определение границ реплик за один проход. Модель доступна как хостинговый API в Meta Model API под именем muse-voice-transcribe-1.0.
- Она достигает конечной ошибки распознавания слов на уровне 3,1% при задержке 0,16 с на бенчмарках Artificial Analysis AA-WER Streaming.
- Обучение с подкреплением тренирует адаптивную политику задержки, которая варьируется для каждого слова, чтобы балансировать точность и скорость.
- Модель поддерживает аудио длительностью более одного часа и нативный код-свитчинг между 70+ языками.
- Стоимость составляет $3.00 за 1 000 минут аудио, что дешевле конкурентов, таких как Cartesia Ink-2 и ElevenLabs Scribe v2 Realtime.
Система обеспечивает диктовку в Meta AI для Mac и Muse Code, предлагая унифицированное решение, которое снижает задержку и ошибки, связанные с многокомпонентными стеками.