一位研究者请求一名独立的真人标注员对100个土耳其语叙事场景进行标注,以确定低评分者间一致性是源于任务的解释性本质,还是由于标注定义不明确。研究发现,四个大型语言模型和一个基于规则的检测器彼此之间以及与人类参考标准的一致性大致处于随机水平,Cohen’s κ得分范围在0.000到0.185之间。

  • 语料库包含100个双语土耳其语–英语场景,标注了六项工艺特征,包括具象化隐喻。
  • 五个机器评分器针对一组锁定的人类参考标签进行评分,其中100个样本中有9个为正例。
  • 五个评分器之间的原始一致性为74.7%–86.3%,但由于极端的类别分布和kappa悖论,这一数据具有误导性。
  • 研究者区分了两种可能的解释:该特征本质上具有解释性,或者定义对作者而言清晰但对其他人而言未充分确定。

无论结果如何,该研究都将被发表,从而提供关于此类特征是否可以委托给机器或是否需要更清晰的人类指南的实质性发现。