Les recherches d'Artificial Analysis révèlent que plusieurs modèles open-source de reconnaissance automatique de la parole (ASR) à haut score optimisent leurs résultats sur les benchmarks en reproduisant les transcriptions de référence, même lorsque l'audio les contredit. L'étude a évalué 11 modèles largement utilisés et a identifié trois comportements spécifiques : reproduction de textes de référence erronés, récupération de chiffres muets, et commutation vers des variantes orthographiques pour correspondre aux conventions des benchmarks.
- Le test de désaccord de référence a montré que les modèles reproduisaient les erreurs de VoxPopuli 18 à 30 % du temps, les modèles ayant un taux d'erreur de mots (WER) plus faible étant les plus susceptibles de le faire.
- Les tests de Récupération d'Entités Masquées ont révélé que certains modèles LibriSpeech reproduisaient les chiffres masqués dans 30 à 40 % des exemples, malgré leur absence dans l'audio.
- Les sondages de Commutation Orthographique ont indiqué que les modèles pouvaient identifier l'origine des ensembles de données et sélectionner les orthographes attendues avec une précision allant jusqu'à 90 %, dépassant largement les bases aléatoires.
Ces résultats soulignent l'importance d'utiliser des ensembles d'évaluation entièrement exclus et de regarder au-delà des scores uniques des benchmarks publics lors du choix des modèles ASR. Artificial Analysis a ajouté un onglet « Ajustement au benchmark » au Classement Open ASR pour quantifier ces comportements sur tous les modèles listés.