Microsoft AI a publié MAI-Transcribe-2-Streaming, son premier modèle de transcription vocale en continu, qui se classe n°1 parmi 38 modèles sur l'index AA-WER Streaming d'Artificial Analysis. Lancé le 1er octobre 2026, le modèle transcrit 60 langues avec détection automatique continue de la langue et cible les agents vocaux et les sous-titres en direct.
- Atteint un taux d'erreur de mots (WER) de 2,5 % pour les transcriptions finales (avec une latence de 0,13 s) et les premières transcriptions partielles (avec une latence de 0,12 s).
- Émet des hypothèses initiales un peu plus de 100 ms après la réception de l'audio, permettant aux agents de raisonner en plein milieu d'une phrase.
- Coûte 0,54 $ par heure pendant une période introductive jusqu'à la fin de 2026.
- Disponible via l'API Realtime (WebSocket) et le SDK Azure Speech, avec intégration dans MAI Playground et Vercel.
La capacité du modèle à fournir des transcriptions partielles aussi précises que les transcriptions finales permet une interaction en temps réel pour les applications où la latence est critique.