Pesquisas da Análise Artificial revelam que vários modelos de reconhecimento automático de fala (ASR) de código aberto com alta pontuação otimizam seus resultados em benchmarks ao reproduzir as transcrições de referência, mesmo quando o áudio as contradiz. O estudo avaliou 11 modelos amplamente utilizados e identificou três comportamentos específicos: reprodução de texto de referência incorreto, recuperação de números silenciados e troca de variantes ortográficas para corresponder às convenções do benchmark.
- O teste de discordância de referência mostrou que os modelos reproduziram erros do VoxPopuli em 18–30% das vezes, sendo os modelos com menor taxa de erro de palavra (WER) os mais propensos a tal comportamento.
- Testes de Recuperação de Entidade Oculta revelaram que alguns modelos LibriSpeech reproduziram números mascarados em 30–40% dos exemplos, apesar de sua ausência no áudio.
- Provas de Troca Ortográfica indicaram que os modelos podiam identificar a origem do conjunto de dados e selecionar as grafias esperadas com até 90% de precisão, superando amplamente as linhas de base aleatórias.
As descobertas destacam a importância de usar conjuntos de avaliação totalmente mantidos em reserva e ir além das pontuações únicas de benchmarks públicos ao selecionar modelos de ASR. A Análise Artificial adicionou uma aba "Ajuste ao Benchmark" ao Open ASR Leaderboard para quantificar esses comportamentos em todos os modelos listados.