A Microsoft AI lançou o MAI-Transcribe-2-Streaming, seu primeiro modelo de fala para texto em streaming, que ocupa a posição #1 entre 38 modelos no índice AA-WER Streaming do Artificial Analysis. Lançado em 1º de outubro de 2026, o modelo transcreve 60 idiomas com detecção contínua e automática de idioma e tem como alvo agentes de voz e legendas ao vivo.
- Alcança uma Taxa de Erro de Palavras (WER) de 2,5% tanto para as transcrições finais (com latência de 0,13s) quanto para as primeiras transcrições parciais (com latência de 0,12s).
- Emite hipóteses iniciais pouco mais de 100ms após receber o áudio, permitindo que os agentes raciocinem no meio da frase.
- Custa US$ 0,54 por hora durante um período promocional até o final de 2026.
- Disponível via Realtime API (WebSocket) e Azure Speech SDK, com integração no MAI Playground e Vercel.
A capacidade do modelo de fornecer transcrições parciais tão precisas quanto as finais permite interação em tempo real para aplicativos onde a latência é crítica.