한 연구자는 판독자 간 낮은 일치율이 과제의 해석적 성격에서 비롯된 것인지, 아니면 모호한 주석 정의에서 비롯된 것인지를 파악하기 위해 100개의 터키어 내러티브 장면을 라벨링할 독립적인 인간 주석 작성자 한 명을 요청하고 있습니다. 연구 결과, 네 개의 LLM과 규칙 기반 검출기가 서로 그리고 인간 기준과 약간의 수준으로 일치했으며, Cohen’s κ 점수는 0.000에서 0.185 사이였습니다.
- 코퍼스는 재현된 은유를 포함한 여섯 가지 공예 특성에 대해 주석이 달린 100개의 양국어 터키어–영어 장면으로 구성됩니다.
- 다섯 명의 기계 판독기가 100개 중 9개의 양성 레이블을 포함하는 고정된 인간 기준 레이블 세트에 대해 점수를 매겼습니다.
- 다섯 판독기 간의 원시 일치는 74.7%–86.3%였으나, 이는 극단적인 클래스 분포와 카파 역설로 인해 오해를 불러일으킬 수 있습니다.
- 연구자는 두 가지 가능한 설명을 구분합니다: 해당 특성이 본질적으로 해석적이라는 점, 또는 정의가 저자에게는 명확하지만 다른 이들에게는 불충분하게 결정되었다는 점입니다.
이 결과는 결과와 관계없이 출판될 예정이며, 이러한 특성을 기계에 위임할 수 있는지 아니면 더 명확한 인간 지침이 필요한지에 대한 실질적인 발견을 제공합니다.