Um estudo de acompanhamento testou Claude Fable 5 e ChatGPT 5.5 contra um anotador humano na característica inferencial da metáfora materializada usando 100 cenas. A análise revelou discrepâncias significativas nos limiares de detecção entre LLMs, com Claude identificando 78 instâncias e ChatGPT 40, em comparação a contagens próximas de zero para outros modelos.

  • Nas metáforas materializadas, os anotadores humanos encontraram 9/100 instâncias, enquanto Grok encontrou 0, Gemini ~2, ChatGPT 40 e Claude 78.
  • As pontuações de concordância (κ) foram aproximadamente zero para as características mais difíceis, sugerindo que a própria definição contribui para a variância.
  • O estudo corrige afirmações anteriores de que a contradição atmosférica era à prova de máquina, mostrando concordância mensurável para Claude (κ 0.27) e ChatGPT (κ 0.18).

O conjunto de dados e o script de pontuação determinístico estão disponíveis no Hugging Face para recomputação sem envolvimento do modelo.