Исследование Artificial Analysis показывает, что несколько высоко оцениваемых моделей распознавания речи с открытым исходным кодом (ASR) оптимизируются под бенчмарки, воспроизводя эталонные транскрипты даже тогда, когда аудио им противоречит. В исследовании были оценены 11 широко используемых моделей и выявлены три конкретных поведения: воспроизведение ошибочного эталонного текста, восстановление замаскированных чисел и переключение орфографических вариантов для соответствия стандартам бенчмарка.
- Тест на расхождение с эталоном показал, что модели воспроизводили ошибки VoxPopuli в 18–30% случаев, причем модели с более низким уровнем ошибок (WER) были наиболее склонны к этому.
- Тесты извлечения замаскированных сущностей выявили, что некоторые модели LibriSpeech воспроизводили замаскированные числа в 30–40% примеров, несмотря на их отсутствие в аудио.
- Зонды переключения орфографии показали, что модели способны определять происхождение набора данных и выбирать ожидаемые варианты написания с точностью до 90%, что значительно превышает случайные базовые показатели.
Эти выводы подчеркивают важность использования полностью изолированных наборов для оценки и выхода за рамки единичных публичных результатов бенчмарков при выборе моделей ASR. Artificial Analysis добавила вкладку «Подгонка под бенчмарк» в таблицу лидеров Open ASR Leaderboard, чтобы количественно оценить эти поведения для всех перечисленных моделей.