В последующем исследовании Claude Fable 5 и ChatGPT 5.5 сравнивались с человеческим аннотатором по инференциальной особенности материализованной метафоры на выборке из 100 сцен. Анализ выявил значительные расхождения в порогах обнаружения среди LLM: Claude идентифицировал 78 случаев, а ChatGPT — 40, тогда как у других моделей счёт был близок к нулю.

  • По материализованным метафорам человеческие аннотаторы нашли 9 из 100 случаев, Grok — 0, Gemini — около 2, ChatGPT — 40, а Claude — 78.
  • Коэффициенты согласия (κ) были примерно равны нулю для самых сложных признаков, что предполагает, что сама формулировка определения вносит вклад в дисперсию.
  • Исследование опровергает прежние утверждения о том, что противоречие атмосферы неуязвимо для машин, показывая измеримое согласие для Claude (κ 0.27) и ChatGPT (κ 0.18).

Набор данных и детерминированный скрипт оценки доступны на Hugging Face для повторного вычисления без участия моделей.