Un investigador está solicitando un único anotador humano independiente para etiquetar 100 escenas narrativas turcas con el fin de determinar si el bajo acuerdo interevaluador se debe a la naturaleza interpretativa de la tarea o a definiciones de anotación insuficientemente especificadas. El estudio encontró que cuatro LLM y un detector basado en reglas coincidieron entre sí y con la referencia humana aproximadamente al azar, con puntuaciones de κ de Cohen que oscilan entre 0.000 y 0.185.
- El corpus consta de 100 escenas bilingües turco-inglés anotadas para seis características artesanales, incluyendo metáfora materializada.
- Cinco evaluadores automáticos puntuaron en comparación con un conjunto fijo de etiquetas de referencia humana que contenía 9 positivos de cada 100.
- El acuerdo bruto entre los cinco evaluadores fue del 74.7%–86.3%, pero esto es engañoso debido a la distribución extrema de clases y a la paradoja de kappa.
- El investigador distingue entre dos posibles explicaciones: que la característica sea inherentemente interpretativa, o que la definición sea clara para el autor pero subdeterminada para otros.
El resultado se publicará independientemente del desenlace, proporcionando un hallazgo sustantivo sobre si dichas características pueden delegarse a máquinas o requieren directrices humanas más claras.