ある研究者は、タスクの解釈的性質に起因するのか、あるいは注釈定義が未確定であることに起因するのかを判断するために、100のトルコ語物語シーンをラベル付けする単一の独立した人間注釈担当者の依頼を行っている。本研究では、4つのLLMとルールベースの検出器が互いに、かつ人間の参照データとほぼ偶然レベルで合意しており、Cohen’s κスコアは0.000から0.185の範囲であった。

  • コーパスは、具現化された比喩など6つの工芸的特徴について注釈が付けられた100の二言語(トルコ語–英語)シーンで構成されている。
  • 5人の機械評価者は、100件中9件が陽性である固定された人間の参照ラベルセットに対してスコアリングを行った。
  • 5人の評価者間の生合意率は74.7%–86.3%であったが、これは極端なクラス分布とカッパのパラドックスにより誤解を招くものである。
  • 研究者は2つの可能な説明を区別している:その特徴が本質的に解釈的であるか、あるいは定義は著者には明確だが他者に対して決定不十分であるか。

この結果は、そのような特徴を機械に委譲できるかどうか、またはより明確な人間のガイドラインを必要とするかどうかに関する実質的な知見を提供するため、いかなる結果であれ公開される。