माइक्रोसॉफ्ट AI ने MAI-Transcribe-2-Streaming जारी किया है, यह उनका पहला स्ट्रीमिंग स्पीच-टू-टेक्स्ट मॉडल है, जो आर्टिफिशियल एनालिसिस AA-WER Streaming इंडेक्स पर 38 मॉडलों में से #1 रैंक पर है। 1 अक्टूबर, 2026 को लॉन्च किए गए इस मॉडल में लगातार स्वचालित भाषा पहचान के साथ 60 भाषाओं का ट्रांसक्रिप्शन होता है और यह वॉइस एजेंट्स और लाइव कैप्शंस को निशाना बनाता है।
- अंतिम ट्रांसक्रिप्शन (0.13s लेटेंसी पर) और पहले आंशिक ट्रांसक्रिप्शन (0.12s लेटेंसी पर) दोनों के लिए 2.5% शब्द त्रुटि दर (WER) प्राप्त करता है।
- ऑडियो प्राप्त करने के ठीक बाद 100ms से थोड़ा अधिक समय में प्रारंभिक अनुमान उत्पन्न करता है, जिससे एजेंट्स वाक्य के बीच में तर्क कर सकते हैं।
- वर्ष 2026 के अंत तक एक परिचयात्मक अवधि के दौरान प्रति घंटे $0.54 की लागत आती है।
- रियलटाइम API (WebSocket) और एज़्योर स्पीच SDK के माध्यम से उपलब्ध, MAI प्लेटफ़ॉर्म और Vercel में एकीकरण के साथ।
अंतिम ट्रांसक्रिप्शन के बराबर सटीकता वाले आंशिक ट्रांसक्रिप्शन प्रदान करने की मॉडल की क्षमता उन अनुप्रयोगों के लिए वास्तविक समय की अंतःक्रिया को सक्षम बनाती है जहां लेटेंसी महत्वपूर्ण होती है।