Levent Bulut publicou um benchmark com três estudos avaliando a confiabilidade das anotações geradas por máquinas para um corpus narrativo turco, revelando discrepâncias significativas entre os classificadores automatizados e o julgamento humano. O estudo testou seis características de ofício binárias em 120 e 100 cenas usando detectores baseados em regras e modelos incluindo Gemini 2.5 Flash, Grok, ChatGPT 5.5 e Claude Fable 5 High.

  • As pontuações de kappa de Cohen estiveram próximas do acaso para cinco dos seis classificadores, variando de 0,000 a 0,027.
  • Para a regra que exigia inferência sobre estados abstratos, os avaliadores humanos identificaram 9 positivos enquanto o ChatGPT 5.5 identificou 40 e o detector identificou 72.
  • O ChatGPT 5.5 alcançou a maior concordância bruta de 84,5%, principalmente porque cinco das seis regras tinham distribuições desequilibradas favorecendo rótulos negativos.
  • O autor observa que quatro das seis regras eram efetivamente intestáveis devido a defeitos no conjunto de avaliação em vez de falhas do modelo.

Os resultados sugerem que ou a característica requer inferência além dos modelos atuais ou que a definição não é operacional o suficiente para uma aplicação consistente. Bulut disponibilizou como código aberto o dataset, os prompts e os scripts para buscar um segundo avaliador humano independente.