Levent Bulut a publié un benchmark composé de trois études évaluant la fiabilité des annotations générées par machine pour un corpus narratif turc, révélant d'importantes divergences entre les évaluateurs automatisés et le jugement humain. L'étude a testé six caractéristiques binaires sur 120 et 100 scènes en utilisant des détecteurs basés sur des règles et des modèles incluant Gemini 2.5 Flash, Grok, ChatGPT 5.5 et Claude Fable 5 High.

  • Les scores de kappa de Cohen étaient proches du hasard pour cinq des six évaluateurs, variant de 0,000 à 0,027.
  • Pour la règle exigeant une inférence sur des états abstraits, les évaluateurs humains ont identifié 9 positifs tandis que ChatGPT 5.5 en a identifié 40 et le détecteur 72.
  • ChatGPT 5.5 a obtenu l'accord brut le plus élevé à 84,5 %, principalement parce que cinq des six règles présentaient des distributions déséquilibrées favorisant les étiquettes négatives.
  • L'auteur note que quatre des six règles étaient effectivement non testables en raison de défauts dans l'ensemble d'évaluation plutôt que de défaillances des modèles.

Les résultats suggèrent soit que la caractéristique nécessite une inférence au-delà des capacités des modèles actuels, soit que la définition n'est pas assez opérationnelle pour une application cohérente. Bulut a open-sourcé le jeu de données, les prompts et les scripts afin de rechercher un second évaluateur humain indépendant.