Open ASR Leaderboard 首次引入了全球南方语言,包含两个新的评估集:Monsoon en-IN(印度英语)和 Monsoon hi-IN(印地语)。这些新增内容旨在解决当前基准测试中人口统计多样性不足的问题,而过去的基准测试历来侧重于欧洲语言。

  • 数据集涵盖四个公共和私有划分中的 4,888 个说话人互不重叠的说话人。
  • 数据通过 Voice Arena 平台从数百个地区收集,以确保广泛的地理和设备覆盖范围。
  • 每个片段包含 12 个元数据字段,如年龄、性别、职业和手机型号。
  • 印地语集利用格(lattices)来处理正字法变体,而非使用标准的字符串引用。
  • 收集过程在九个维度上有所变化,包括地理、年龄、性别、词汇量和声学环境。

这一扩展使得能够针对不同人群对 ASR 性能进行分解分析,揭示出聚合 WER 分数所掩盖的错误率差异。