Artificial Analysis 的研究揭示,多个高分开源自动语音识别(ASR)模型在优化基准测试时,即使音频内容与参考转录文本相矛盾,仍会复现这些参考转录文本。该研究评估了 11 个广泛使用的模型,并确定了三种特定行为:复现错误的参考文本、恢复被静音的数字,以及切换正字法变体以匹配基准规范。
- 参考分歧探针显示,模型在 18%–30% 的情况下复现了 VoxPopuli 的错误,其中词错误率(WER)较低的模型最有可能这样做。
- 掩码实体检索测试发现,部分 LibriSpeech 模型在 30%–40% 的示例中复现了被掩码的数字,尽管音频中并不存在这些数字。
- 正字法切换探针表明,模型能够识别数据集来源并以高达 90% 的准确率选择预期的拼写方式,远超随机基线。
这些发现强调了在使用完全保留的评估集以及在选择 ASR 模型时超越单一公开基准分数的重要性。Artificial Analysis 已在 Open ASR Leaderboard 中添加了“基准拟合”标签,以量化所有列出模型的这些行为。