A Meta Superintelligence Labs lançou o Muse Voice Transcribe, um único modelo autoregressivo que realiza reconhecimento automático de fala (ASR) em streaming, diárioização de falantes para mais de 20 falantes e detecção de fim de frase em uma única passagem. O modelo está disponível como uma API hospedada na Meta Model API sob o nome muse-voice-transcribe-1.0.

  • Ele alcança uma taxa de erro de palavra final de 3,1% com latência de 0,16s nos benchmarks AA-WER Streaming do Artificial Analysis.
  • O aprendizado por reforço treina uma política de atraso adaptativo que varia por palavra para equilibrar precisão e velocidade.
  • O modelo suporta entradas de áudio superiores a uma hora e alternância de código nativa em mais de 70 idiomas.
  • O preço é de US$ 3,00 por 1.000 minutos de áudio, abaixo dos concorrentes como Cartesia Ink-2 e ElevenLabs Scribe v2 Realtime.

O sistema alimenta a ditatação no Meta AI para Mac e Muse Code, oferecendo uma solução unificada que reduz a latência e os modos de falha associados a pilhas com múltiplos modelos.