ओपन एएसआर लीडरबोर्ड ने दो नए मूल्यांकन सेट: मॉन्सून en-IN (भारतीय अंग्रेजी) और मॉन्सून hi-IN (हिंदी) के साथ अपने पहले ग्लोबल साउथ भाषाओं को पेश किया है। ये जोड़ मौजूदा बेंचमार्क्स में जनसांख्यिकीय विविधता की कमी को दूर करते हैं, जिन्होंने ऐतिहासिक रूप से यूरोपीय भाषाओं पर ध्यान केंद्रित किया है।
- डेटासेट चार सार्वजनिक और निजी स्प्लिट में 4,888 वक्ता-विहीन वक्ताओं का निर्माण करते हैं।
- व्यापक भौगोलिक और डिवाइस कवरेज सुनिश्चित करने के लिए डेटा सैकड़ों जिलों से वॉयस एरिना प्लेटफ़ॉर्म के माध्यम से एकत्र किया गया था।
- प्रत्येक खंड में आयु, लिंग, व्यवसाय और हैंडसेट मॉडल जैसे 12 मेटाडेटा फ़ील्ड शामिल हैं।
- हिंदी सेट मानक स्ट्रिंग संदर्भों के बजाय वर्णमाला भिन्नता को संभालने के लिए लेटिस का उपयोग करते हैं।
- संग्रह भूगोल, आयु, लिंग, शब्दावली और ध्वनिक वातावरण सहित नौ अक्षों के साथ भिन्न होता है।
यस विस्तार विविध आबादी के across ASR प्रदर्शन का असंयोजित विश्लेषण की अनुमति देता है, जो एग्रीगेट WER स्कोर छुपाते हैं त्रुटि दर असमानताओं को उजागर करता है।