Un estudio posterior probó a Claude Fable 5 y ChatGPT 5.5 frente a un anotador humano sobre la característica inferencial de metáfora materializada utilizando 100 escenas. El análisis reveló discrepancias significativas en los umbrales de detección entre los LLM, con Claude identificando 78 instancias y ChatGPT 40, en comparación con conteos cercanos a cero para otros modelos.

  • En las metáforas materializadas, los anotadores humanos encontraron 9/100 instancias, mientras que Grok encontró 0, Gemini ~2, ChatGPT 40 y Claude 78.
  • Las puntuaciones de acuerdo (κ) fueron aproximadamente cero para las características más difíciles, lo que sugiere que la propia definición contribuye a la varianza.
  • El estudio corrige afirmaciones anteriores de que la contradicción atmosférica era inmune a las máquinas, mostrando un acuerdo medible para Claude (κ 0.27) y ChatGPT (κ 0.18).

El conjunto de datos y el script de puntuación determinista están disponibles en Hugging Face para su recomputación sin intervención del modelo.