أطلقت مايكروسوفت للذكاء الاصطناعي نموذج MAI-Transcribe-2-Streaming، وهو أول نموذج لديها لتحويل الكلام إلى نص في الوقت الفعلي، ويتصدر الترتيب الأول من بين 38 نموذجاً على مؤشر AA-WER Streaming الخاص بـ Artificial Analysis. أُطلق النموذج في 1 أكتوبر 2026، ويقوم بنسخ 60 لغة مع كشف تلقائي مستمر للغة، ويستهدف وكلاء الصوت والترجمات الفورية.
- يحقق معدل خطأ كلمات (WER) بنسبة 2.5% لكل من النصوص النهائية (بزمن استجابة 0.13 ثانية) والنصوص الجزئية الأولى (بزمن استجابة 0.12 ثانية).
- يُصدر الافتراضات الأولية بعد أقل قليلاً من 100 مللي ثانية من استلام الصوت، مما يسمح للوكلاء بالاستدلال أثناء جمل الكلام.
- يكلف 0.54 دولار لكل ساعة خلال فترة تمهيدية تمتد حتى نهاية عام 2026.
- متاح عبر واجهة برمجة التطبيقات في الوقت الفعلي (WebSocket) وAzure Speech SDK، مع التكامل في MAI Playground وVercel.
تتيح قدرة النموذج على توفير نصوص جزئية بنفس دقة النصوص النهائية تفاعلاً فورياً للتطبيقات التي يكون فيها زمن الاستجابة حاسماً.