أطلقت مختبرات الذكاء الفائق من ميتا (Meta Superintelligence Labs) أداة موس فايس ترانسبرايب، وهي نموذج أحادي ذاتي الانحدار يؤدي التعرف التلقائي على الكلام البثّي (ASR)، وتصنيف المتحدثين لأكثر من 20 متحدثاً، وتحديد نقاط النهاية في عملية واحدة. يتوفر النموذج كواجهة برمجة تطبيقات مستضافة على واجهة ميتا للبرمجيات للنماذج تحت الاسم muse-voice-transcribe-1.0.

  • يحقق نسبة خطأ كلمات نهائيّة بنسبة 3.1% بزمن استجابة قدره 0.16 ثانية في اختبارات AA-WER البثية من Artificial Analysis.
  • يُدرَّب التعلم التعزيزي سياسة تأقلم زمني تتغير لكل كلمة لموازنة الدقة والسرعة.
  • يدعم النموذج مدخلات صوتية تزيد عن ساعة واحدة والتبديل اللغوي الأصلي عبر أكثر من 70 لغة.
  • تبلغ الأسعار 3.00 دولار لكل 1,000 دقيقة صوتية، مما يقلل التكلفة مقارنة بالمنافسين مثل Cartesia Ink-2 وElevenLabs Scribe v2 Realtime.

تُشغّل النظام إملاءات في ميتا آي لـ Mac وموس كود، مما يوفر حلاً موحداً يقلل من زمن الاستجابة وأنماط الفشل المرتبطة بمجموعات النماذج المتعددة.