Levent Bulut 发布了一项包含三项研究的基准测试,评估土耳其叙事语料库中机器生成标注的可靠性,揭示了自动评分器与人类判断之间的显著差异。该研究使用基于规则的检测器以及 Gemini 2.5 Flash、Grok、ChatGPT 5.5 和 Claude Fable 5 High 等模型,对 120 个和 100 个场景中的六个二元工艺特征进行了测试。
- 对于五个评分器而言,Cohen’s kappa 分数接近随机水平,范围在 0.000 到 0.027 之间。
- 对于需要推断抽象状态的那条规则,人类评分者识别出 9 个正例,ChatGPT 5.5 识别出 40 个,检测器识别出 72 个。
- ChatGPT 5.5 实现了最高的原始一致性(84.5%),主要原因是六个规则中有五个的分布严重偏向负标签。
- 作者指出,由于评估集存在缺陷而非模型失败,六条规则中有四条实际上无法测试。
结果表明,要么该特征需要超出当前模型能力的推断,要么其定义不够可操作,难以一致应用。Bulut 已开源数据集、提示词和脚本,以寻求第二位独立的人类评分者。