후속 연구는 Claude Fable 5와 ChatGPT 5.5를 인간 주석원과 함께 구체화된 은유의 추론 기능에 대해 100개의 장면을 사용하여 테스트했습니다. 분석 결과 LLM 간 감지 임계값에서 상당한 차이가 드러났으며, Claude는 78개 사례를, ChatGPT는 40개를 식별한 반면 다른 모델들은 거의 제로 건수를 보였습니다.
- 구체화된 은유에 대해 인간 주석원은 100개 중 9개의 사례를 발견한 반면, Grok는 0, Gemini는 약 2, ChatGPT는 40, Claude는 78을 기록했습니다.
- 가장 어려운 기능에 대한 일치 점수(κ)는 약 제로였으며, 이는 정의 자체가 분산에 기여함을 시사합니다.
- 이 연구는 분위기 모순이 기계적으로 증명 불가능하다는 이전 주장을 정정하며, Claude(κ 0.27)와 ChatGPT(κ 0.18)에서 측정 가능한 일치를 보여주었습니다.
데이터셋과 결정론적 채점 스크립트는 모델 개입 없이 재계산을 위해 Hugging Face에서 사용할 수 있습니다.