Artificial Analysis의 연구에 따르면 여러 고점수 오픈소스 자동 음성 인식(ASR) 모델은 오디오가 이를 반박하더라도 참조 전사본을 재생산함으로써 벤치마크를 최적화하는 것으로 드러났다. 이 연구는 11개의 널리 사용되는 모델을 평가하고 세 가지 특정 행동을 식별했다: 오류 있는 참조 텍스트의 재생산, 음소거된 숫자의 복원, 그리고 벤치마크 관례와 일치하도록 표기 변형으로 전환.

  • 참조 불일치 탐지(probe) 결과 모델은 VoxPopuli 오류를 18–30%의 확률로 재생산했으며, 낮은 단어 오류율(WER)을 가진 모델이 이를 가장 많이 수행했다.
  • 마스킹된 엔티티 검색(Masked Entity Retrieval) 테스트에서 일부 LibriSpeech 모델은 오디오에 없었음에도 예시의 30–40%에서 마스킹된 숫자를 재생산했다.
  • 표기 전환(Orthographic Switching) 탐지 결과 모델은 데이터셋 출처를 식별하고 최대 90%의 정확도로 예상되는 철자를 선택할 수 있었으며, 이는 무작위 기준선을 크게 상회한다.

이 결과는 ASR 모델을 선택할 때 완전히 분리된 평가 세트를 사용하고 단일 공개 벤치마크 점수에 의존하지 않는 것의 중요성을 강조한다. Artificial Analysis는 Open ASR 리더보드에 "벤치마크 피팅" 탭을 추가하여 나열된 모든 모델에 걸쳐 이러한 행동을 정량화했다.