Papan Peringkat ASR Terbuka telah memperkenalkan bahasa Global South pertamanya dengan dua set evaluasi baru: Monsoon en-IN (Inggris India) dan Monsoon hi-IN (Hindi). Penambahan ini mengatasi kurangnya keragaman demografis dalam benchmark saat ini, yang secara historis berfokus pada bahasa Eropa.
- Dataset terdiri dari 4.888 pembicara yang tidak tumpang tindih di empat split publik dan privat.
- Data dikumpulkan melalui platform Voice Arena dari ratusan distrik untuk memastikan cakupan geografis dan perangkat yang luas.
- Setiap segmen mencakup 12 bidang metadata seperti usia, jenis kelamin, pekerjaan, dan model handset.
- Set Hindi memanfaatkan lattice untuk menangani variasi ortografis daripada referensi string standar.
- Pengumpulan bervariasi sepanjang sembilan sumbu termasuk geografi, usia, jenis kelamin, kosakata, dan lingkungan akustik.
Ekspansi ini memungkinkan analisis terdisagregasi kinerja ASR di berbagai populasi, mengungkap disparitas tingkat kesalahan yang disembunyikan oleh skor WER agregat.