Levent Bulut publicó un benchmark de tres estudios que evalúa la fiabilidad de las anotaciones generadas por máquinas para un corpus narrativo turco, revelando discrepancias significativas entre los evaluadores automatizados y el juicio humano. El estudio probó seis características artesanales binarias en 120 y 100 escenas utilizando detectores basados en reglas y modelos como Gemini 2.5 Flash, Grok, ChatGPT 5.5 y Claude Fable 5 High.

  • Las puntuaciones de kappa de Cohen estuvieron cerca del azar para cinco de los seis evaluadores, oscilando entre 0.000 y 0.027.
  • Para la regla que requiere inferencia sobre estados abstractos, los evaluadores humanos identificaron 9 positivos mientras que ChatGPT 5.5 identificó 40 y el detector identificó 72.
  • ChatGPT 5.5 logró la mayor coincidencia bruta del 84.5%, principalmente porque cinco de las seis reglas tenían distribuciones desequilibradas que favorecían las etiquetas negativas.
  • El autor señala que cuatro de las seis reglas eran efectivamente no evaluables debido a defectos en el conjunto de evaluación en lugar de fallos del modelo.

Los resultados sugieren que la característica requiere inferencia más allá de los modelos actuales o que la definición no es lo suficientemente operativa para una aplicación consistente. Bulut ha liberado como código abierto el conjunto de datos, las instrucciones y los scripts para buscar un segundo evaluador humano independiente.