Um pesquisador está solicitando que um único anotador humano independente rotule 100 cenas narrativas turcas para determinar se o baixo acordo entre avaliadores decorre da natureza interpretativa da tarefa ou de definições de anotação mal especificadas. O estudo constatou que quatro LLMs e um detector baseado em regras concordaram entre si e com a referência humana aproximadamente no nível do acaso, com escores de κ de Cohen variando de 0,000 a 0,185.

  • O corpus consiste em 100 cenas bilíngues turco–inglês anotadas para seis características de ofício, incluindo metáfora materializada.
  • Cinco avaliadores automáticos foram pontuados contra um conjunto fixo de rótulos de referência humana contendo 9 positivos entre 100.
  • O acordo bruto entre os cinco avaliadores foi de 74,7%–86,3%, mas isso é enganoso devido à distribuição extrema de classes e ao paradoxo do kappa.
  • O pesquisador distingue entre duas possíveis explicações: a característica é inerentemente interpretativa, ou a definição é clara para o autor, mas subdeterminada para outros.

O resultado será publicado independentemente do desfecho, fornecendo uma descoberta substantiva sobre se tais características podem ser delegadas a máquinas ou exigem diretrizes humanas mais claras.