Meta Superintelligence Labs выпустила Muse Voice Transcribe — единую авторегрессионную модель, выполняющую потоковую автоматическую распознавание речи (ASR), диаризацию говорящих для 20+ участников и определение границ реплик за один проход. Модель доступна как хостинговый API в Meta Model API под именем muse-voice-transcribe-1.0.

  • Она достигает конечной ошибки распознавания слов на уровне 3,1% при задержке 0,16 с на бенчмарках Artificial Analysis AA-WER Streaming.
  • Обучение с подкреплением тренирует адаптивную политику задержки, которая варьируется для каждого слова, чтобы балансировать точность и скорость.
  • Модель поддерживает аудио длительностью более одного часа и нативный код-свитчинг между 70+ языками.
  • Стоимость составляет $3.00 за 1 000 минут аудио, что дешевле конкурентов, таких как Cartesia Ink-2 и ElevenLabs Scribe v2 Realtime.

Система обеспечивает диктовку в Meta AI для Mac и Muse Code, предлагая унифицированное решение, которое снижает задержку и ошибки, связанные с многокомпонентными стеками.