一项后续研究使用100个场景,测试了 Claude Fable 5 和 ChatGPT 5.5 与人类标注者在具象化隐喻这一推断特征上的表现。分析显示,不同大语言模型在检测阈值上存在显著差异,Claude 识别出78个实例,ChatGPT 识别出40个,而其他模型的计数接近于零。
- 在具象化隐喻方面,人类标注者发现了9/100个实例,而 Grok 为0,Gemini 约为2,ChatGPT 为40,Claude 为78。
- 最难特征的一致性得分(κ)接近于零,表明定义本身导致了方差。
- 该研究纠正了此前关于氛围矛盾具有机器不可检测性的说法,显示出 Claude(κ 0.27)和 ChatGPT(κ 0.18)的可测量一致性。
数据集和确定性评分脚本已在 Hugging Face 上提供,可供在不涉及模型的情况下重新计算。