Microsoft AI ha lanzado MAI-Transcribe-2-Streaming, su primer modelo de voz a texto en streaming, que se clasifica como #1 de 38 modelos en el índice AA-WER Streaming de Artificial Analysis. Lanzado el 1 de octubre de 2026, el modelo transcribe 60 idiomas con detección continua del idioma y está dirigido a agentes de voz y subtítulos en vivo.
- Alcanza una Tasa de Error de Palabras (WER) del 2,5% tanto para los transcritos finales (con latencia de 0,13s) como para los primeros transcritos parciales (con latencia de 0,12s).
- Emite hipótesis iniciales poco más de 100ms después de recibir el audio, permitiendo a los agentes razonar en medio de una frase.
- Cuesta $0.54 por hora durante un período introductorio hasta finales de 2026.
- Disponible a través de la API Realtime (WebSocket) y Azure Speech SDK, con integración en MAI Playground y Vercel.
La capacidad del modelo para proporcionar transcritos parciales tan precisos como los finales permite la interacción en tiempo real para aplicaciones donde la latencia es crítica.