Un chercheur demande à un seul annotateur humain indépendant d'étiqueter 100 scènes narratives turques afin de déterminer si le faible accord inter-évaluateurs provient du caractère interprétatif de la tâche ou de définitions d'annotation mal précisées. L'étude a révélé que quatre LLM et un détecteur basé sur des règles étaient en accord entre eux et avec la référence humaine à un niveau proche du hasard, les scores de κ de Cohen variant de 0,000 à 0,185.

  • Le corpus comprend 100 scènes bilingues turc–anglais annotées pour six caractéristiques artisanales, y compris la métaphore matérialisée.
  • Cinq évaluateurs automatiques ont été notés par rapport à un ensemble figé d'étiquettes de référence humaine contenant 9 positifs sur 100.
  • L'accord brut entre les cinq évaluateurs était de 74,7 %–86,3 %, mais cela est trompeur en raison de la distribution extrême des classes et du paradoxe de kappa.
  • Le chercheur distingue deux explications possibles : la caractéristique est intrinsèquement interprétative, ou la définition est claire pour l'auteur mais sous-déterminée pour les autres.

Le résultat sera publié quel que soit l'issue, apportant une découverte substantielle sur le fait de savoir si de telles caractéristiques peuvent être déléguées aux machines ou nécessitent des directives humaines plus claires.