Microsoft AI telah merilis MAI-Transcribe-2-Streaming, model speech-to-text streaming pertamanya, yang menempati peringkat #1 dari 38 model pada indeks AA-WER Streaming Artificial Analysis. Diluncurkan pada 1 Oktober 2026, model ini mentranskripsi 60 bahasa dengan deteksi bahasa otomatis berkelanjutan dan menargetkan agen suara serta teks berjalan langsung.

  • Mencapai Word Error Rate (WER) sebesar 2,5% untuk transkrip akhir (dengan latensi 0,13 detik) dan transkrip parsial pertama (dengan latensi 0,12 detik).
  • Menghasilkan hipotesis awal tepat di atas 100ms setelah menerima audio, memungkinkan agen bernalung di tengah kalimat.
  • Berbiaya $0,54 per jam selama periode pengenalan hingga akhir 2026.
  • Tersedia melalui Realtime API (WebSocket) dan Azure Speech SDK, dengan integrasi di MAI Playground dan Vercel.

Kemampuan model untuk menyediakan transkrip parsial yang seakurat transkrip akhir memungkinkan interaksi waktu nyata untuk aplikasi di mana latensi sangat kritis.