Рейтинг Open ASR представил свои первые языки Глобального Юга с двумя новыми наборами данных для оценки: Monsoon en-IN (индийский английский) и Monsoon hi-IN (хинди). Эти дополнения устраняют недостаток демографического разнообразия в текущих бенчмарках, которые исторически фокусировались на европейских языках.
- Датасеты включают 4888 говорящих, не пересекающихся по выборке, разделенных на четыре публичных и приватных сплита.
- Данные были собраны через платформу Voice Arena из сотен районов для обеспечения широкого географического охвата и покрытия различными устройствами.
- Каждый сегмент включает 12 полей метаданных, таких как возраст, пол, профессия и модель телефона.
Наборы данных на хинди используют латтицы для обработки орфографических вариаций вместо стандартных строковых ссылок.
- Сбор данных варьировался по девяти осям, включая географию, возраст, пол, словарный запас и акустические условия.
Это расширение позволяет проводить детализированный анализ производительности ASR среди различных групп населения, выявляя различия в уровне ошибок, которые скрывают агрегированные показатели WER.