Meta Superintelligence Labs a publié Muse Voice Transcribe, un modèle autoregressif unique qui effectue la reconnaissance automatique de la parole (ASR) en streaming, la diarisation des locuteurs pour plus de 20 locuteurs et la détection des bornes en une seule passe. Le modèle est disponible en tant qu'API hébergée sur l'API Meta Model API sous le nom muse-voice-transcribe-1.0.
- Il atteint un taux d'erreur de mots (WER) final de 3,1 % avec une latence de 0,16 s sur les benchmarks AA-WER Streaming d'Artificial Analysis.
- L'apprentissage par renforcement entraîne une politique de délai adaptative qui varie selon le mot pour équilibrer précision et vitesse.
- Le modèle prend en charge des entrées audio dépassant une heure et le code-switching natif dans plus de 70 langues.
- Le tarif est de 3,00 $ par 1 000 minutes audio, sous les concurrents tels que Cartesia Ink-2 et ElevenLabs Scribe v2 Realtime.
Le système alimente la dictée dans Meta AI pour Mac et Muse Code, offrant une solution unifiée qui réduit la latence et les modes de défaillance associés aux piles multi-modèles.