La investigación de Artificial Analysis revela que varios modelos de código abierto de reconocimiento automático del habla (ASR) con alta puntuación optimizan para benchmarks reproduciendo las transcripciones de referencia incluso cuando el audio las contradice. El estudio evaluó 11 modelos ampliamente utilizados e identificó tres comportamientos específicos: reproducir texto de referencia erróneo, recuperar números silenciados y cambiar variantes ortográficas para ajustarse a las convenciones del benchmark.

  • La prueba de desacuerdo de referencia mostró que los modelos reprodujeron errores de VoxPopuli entre el 18% y el 30% de las veces, siendo los modelos con menor tasa de error de palabra (WER) los más propensos a hacerlo.
  • Las pruebas de Recuperación de Entidades Enmascaradas encontraron que algunos modelos de LibriSpeech reprodujeron números enmascarados en el 30–40% de los ejemplos a pesar de su ausencia en el audio.
  • Las pruebas de Cambio Ortográfico indicaron que los modelos podían identificar el origen del conjunto de datos y seleccionar las ortografías esperadas con una precisión de hasta el 90%, superando ampliamente las líneas base aleatorias.

Los hallazgos subrayan la importancia de utilizar conjuntos de evaluación completamente retenidos y mirar más allá de las puntuaciones únicas de benchmarks públicos al seleccionar modelos ASR. Artificial Analysis ha añadido una pestaña "Ajuste de Benchmark" al Tablero de Clasificación ASR Abierto para cuantificar estos comportamientos en todos los modelos listados.