Studi lanjutan menguji Claude Fable 5 dan ChatGPT 5.5 terhadap anotator manusia pada fitur inferensial metafora terwujud menggunakan 100 adegan. Analisis mengungkapkan perbedaan signifikan dalam ambang batas deteksi di antara LLM, dengan Claude mengidentifikasi 78 contoh dan ChatGPT 40, dibandingkan hitungan mendekati nol untuk model lainnya.

  • Pada metafora terwujud, anotator manusia menemukan 9/100 contoh, sementara Grok menemukan 0, Gemini ~2, ChatGPT 40, dan Claude 78.
  • Skor kesepakatan (κ) mendekati nol untuk fitur tersulit, menunjukkan bahwa definisi itu sendiri berkontribusi pada varians.
  • Studi ini mengoreksi klaim sebelumnya yang menyatakan kontradiksi atmosfer adalah hal yang tidak bisa dibuktikan oleh mesin, menunjukkan kesepakatan terukur untuk Claude (κ 0.27) dan ChatGPT (κ 0.18).

Dataset dan skrip penilaian deterministik tersedia di Hugging Face untuk komputasi ulang tanpa keterlibatan model.