Evaluation & benchmarks
media Hugging Face Forums · 3 天前 · 16 次浏览

研究者寻求一名独立标注员以解决LLM协议歧义

一位研究者请求一名独立的真人标注员对100个土耳其语叙事场景进行标注,以确定低评分者间一致性是源于任务的解释性本质,还是由于标注定义不明确。研究发现,四个大型语言模型和一个基于规则的检测器彼此之间以及与人类参考标准的一致性大致处于随机水平,Cohen’s κ得分范围在0.000到0.185之间。