Open ASR リーダーボードは、2つの新しい評価セットである Monsoon en-IN(インド英語)と Monsoon hi-IN(ヒンディー語)を通じて、初のグローバルサウス言語を導入しました。これらの追加により、歴史的にヨーロッパの言語に焦点を当ててきた現在のベンチマークにおける人口統計的多様性の欠如という課題に対応します。

  • データセットは、4つの公開および非公開分割に分かれた4,888人の話者で構成されています。
  • 広範な地理的およびデバイスカバレッジを確保するため、Voice Arenaプラットフォームを通じて数百の地区からデータが収集されました。
  • 各セグメントには、年齢、性別、職業、端末モデルなどの12のメタデータフィールドが含まれています。
  • ヒンディー語セットでは、標準的な文字列参照の代わりに正書法の変動を処理するためにラティス(lattice)が利用されています。
  • 収集は地理、年齢、性別、語彙、音響環境など9つの軸に沿って行われています。

この拡張により、多様な人口集団にわたるASRパフォーマンスの詳細な分析が可能になり、集約されたWERスコアでは隠蔽される誤り率の格差が明らかになります。