フォローアップ研究では、100のシーンを用いて、具現化されたメタファーという推論機能について、Claude Fable 5とChatGPT 5.5を人間の注釈者と比較した。分析の結果、LLM間で検出閾値に大きな乖離があることが明らかになり、Claudeは78件のインスタンスを検出し、ChatGPTは40件だったのに対し、他のモデルはほぼゼロだった。

  • 具現化されたメタファーについて、人間の注釈者は100件中9件を検出したが、Grokは0件、Geminiは約2件、ChatGPTは40件、Claudeは78件だった。
  • 最も困難な機能における合意スコア(κ)はほぼゼロであり、定義自体が分散に寄与していることを示唆している。
  • この研究は、以前の大気矛盾が機械には検出不可能であるとする主張を是正し、Claude(κ 0.27)とChatGPT(κ 0.18)で測定可能な合意を示した。

データセットと決定論的な採点スクリプトは、モデルの関与なしに再計算するためにHugging Faceで利用可能である。