Artificial Analysisの研究により、複数の高スコアオープンソース自動音声認識(ASR)モデルが、オーディオと矛盾する場合でも参照テキストを再現することでベンチマークに対して最適化していることが明らかになった。この研究では11の広く使われているモデルを評価し、3つの特定の行動を特定した:誤った参照テキストの再現、沈黙された数字の復元、ベンチマークの慣例に合わせて表記変種への変更。
- 参照不一致プローブは、モデルがVoxPopuliのエラーを18〜30%の頻度で再現することを示し、低い単語誤り率(WER)を持つモデルほどその傾向が強かった。
- マスクされたエンティティ検索テストでは、LibriSpeechのいくつかのモデルが、オーディオに存在しないにもかかわらず、例の30〜40%でマスクされた数字を再現することがわかった。
- 表記切替プローブは、モデルがデータセットの起源を特定し、期待されるスペルを選択できることが示され、その精度は最大90%に達し、ランダムなベースラインを大幅に上回った。
これらの知見は、ASRモデルを選択する際に完全にホールドアウトされた評価セットを使用することと、単一の公開ベンチマークスコアだけでなく他の指標も考慮することの重要性を強調している。Artificial Analysisは、Open ASRリーダーボードに「ベンチマークフィッティング」タブを追加し、リストされたすべてのモデル間でこれらの行動を定量化した。