Une étude complémentaire a testé Claude Fable 5 et ChatGPT 5.5 face à un annotateur humain sur la caractéristique inférentielle de la métaphore matérialisée en utilisant 100 scènes. L'analyse a révélé des écarts significatifs dans les seuils de détection parmi les LLM, Claude identifiant 78 instances et ChatGPT 40, par rapport à des comptes quasi nuls pour les autres modèles.

  • Sur les métaphores matérialisées, les annotateurs humains ont trouvé 9/100 instances, tandis que Grok en a trouvé 0, Gemini ~2, ChatGPT 40 et Claude 78.
  • Les scores d'accord (κ) étaient approximativement nuls pour les caractéristiques les plus difficiles, suggérant que la définition elle-même contribue à la variance.
  • L'étude corrige les affirmations antérieures selon lesquelles la contradiction d'atmosphère était invulnérable aux machines, montrant un accord mesurable pour Claude (κ 0,27) et ChatGPT (κ 0,18).

Le jeu de données et le script de notation déterministe sont disponibles sur Hugging Face pour une recomputation sans implication du modèle.