A Classificação de ASR Aberto introduziu seus primeiros idiomas do Sul Global com dois novos conjuntos de avaliação: Monsoon en-IN (inglês indiano) e Monsoon hi-IN (hindi). Essas adresses abordam a falta de diversidade demográfica nos benchmarks atuais, que historicamente se concentraram em línguas europeias.
- Os conjuntos de dados compreendem 4.888 falantes disjuntos por locutor em quatro divisões públicas e privadas.
- Os dados foram coletados pela plataforma Voice Arena de centenas de distritos para garantir ampla cobertura geográfica e de dispositivos.
- Cada segmento inclui 12 campos de metadados, como idade, gênero, ocupação e modelo de aparelho.
- Os conjuntos de hindi utilizam lattices para lidar com variação ortográfica em vez de referências de string padrão.
- A coleta varia ao longo de nove eixos, incluindo geografia, idade, gênero, vocabulário e ambientes acústicos.
Essa expansão permite uma análise desagregada do desempenho do ASR em populações diversas, revelando disparidades na taxa de erro que as pontuações agregadas de WER ocultam.