Seorang peneliti meminta seorang manusia penilai independen tunggal untuk memberi label pada 100 adegan naratif Turki guna menentukan apakah rendahnya kesepakatan antar-penilai berasal dari sifat interpretatif tugas atau dari definisi anotasi yang kurang spesifik. Studi ini menemukan bahwa empat LLM dan sebuah detektor berbasis aturan sepakat satu sama lain serta dengan referensi manusia pada tingkat kira-kira acak, dengan skor Cohen’s κ berkisar dari 0,000 hingga 0,185.

  • Korpus terdiri dari 100 adegan bilingual Turki–Inggris yang dianotasi untuk enam fitur kerajinan, termasuk metafora terwujud.
  • Lima penilai mesin diberi skor terhadap satu set label referensi manusia yang terkunci, berisi 9 positif dari 100.
  • Kesepakatan mentah di antara kelima penilai adalah 74,7%–86,3%, namun ini menyesatkan karena distribusi kelas yang ekstrem dan paradoks kappa.
  • Peneliti membedakan antara dua penjelasan kemungkinan: fitur tersebut secara inheren interpretatif, atau definisinya jelas bagi penulis tetapi kurang ditentukan bagi orang lain.

Hasilnya akan dipublikasikan terlepas dari hasilnya, memberikan temuan substantif tentang apakah fitur semacam itu dapat didelegasikan ke mesin atau memerlukan pedoman manusia yang lebih jelas.