أضافت لوحة المتصدرين لـ Open ASR لغات الجنوب العالمي الأولى عبر مجموعتي تقييم جديدتين: Monsoon en-IN (الإنجليزية الهندية) وMonsoon hi-IN (الهندية). تعالج هذه الإضافات نقص التنوع الديموغرافي في المعايير الحالية، التي ركزت تاريخيًا على اللغات الأوروبية.

  • تتكون مجموعات البيانات من 4,888 متحدثًا غير متداخلين عبر أربع تقسيمات عامة وخاصة.
  • جُمعت البيانات عبر منصة Voice Arena من مئات المناطق لضمان تغطية جغرافية وجهازية واسعة.
  • يتضمن كل مقطع 12 حقلًا للبيانات الوصفية مثل العمر والجنس والمهنة ونموذج الهاتف.
  • تستخدم مجموعات اللغة الهندية الشبكات (lattices) للتعامل مع الاختلافات الإملائية بدلاً من المراجع النصية القياسية.
  • يختلف الجمع عبر تسعة محاور تشمل الجغرافيا والعمر والجنس والمفردات والبيئات الصوتية.

يتيح هذا التوسع تحليلًا مفصلًا لأداء ASR عبر مجموعات سكانية متنوعة، وكشف تفاوتات في معدلات الأخطاء تخفيها درجات WER المجمعة.