El tablero de clasificación de ASR abierto ha introducido sus primeros idiomas del Sur Global con dos nuevos conjuntos de evaluación: Monsoon en-IN (inglés indio) y Monsoon hi-IN (hindi). Estas adiciones abordan la falta de diversidad demográfica en los benchmarks actuales, que históricamente se han centrado en idiomas europeos.

  • Los conjuntos de datos comprenden 4.888 hablantes disjuntos por orador distribuidos en cuatro divisiones públicas y privadas.
  • Los datos fueron recopilados a través de la plataforma Voice Arena desde cientos de distritos para garantizar una amplia cobertura geográfica y de dispositivos.
  • Cada segmento incluye 12 campos de metadatos como edad, género, ocupación y modelo de teléfono.
  • Los conjuntos en hindi utilizan lattices para manejar la variación ortográfica en lugar de referencias de cadenas estándar.
  • La recopilación varía a lo largo de nueve ejes que incluyen geografía, edad, género, vocabulario y entornos acústicos.

Esta expansión permite un análisis desagregado del rendimiento de ASR entre poblaciones diversas, revelando disparidades en las tasas de error que ocultan los puntajes agregados de WER.