Levent Bulutは、トルコの物語コーパスに対する機械生成注釈の信頼性を評価する3つの研究からなるベンチマークを公開し、自動採点者と人間の判断の間に大きな乖離があることを明らかにした。この研究では、Gemini 2.5 Flash、Grok、ChatGPT 5.5、Claude Fable 5 Highを含むルールベースの検出器とモデルを使用して、120シーンと100シーンの6つのバイナリ工芸特徴がテストされた。
- Cohenのkappaスコアは6人の採点者のうち5人で偶然レベルに近く、0.000から0.027の範囲だった。
- 抽象的な状態に関する推論を必要とするルールでは、人間の採点者が陽性9件を特定したのに対し、ChatGPT 5.5は40件、検出器は72件を特定した。
- ChatGPT 5.5は84.5%という最も高い生合意率を達成したが、これは6つのルール中5つが陰性ラベルに偏った分布を示していたためである。
- 著者は、6つのルール中4つがモデルの失敗ではなく評価セットの欠陥により事実上テスト不可能であると指摘している。
結果は、この特徴が現在のモデルを超える推論を必要とするか、または定義が一貫した適用には十分運用可能ではないことを示唆している。Bulutは、第2の独立した人間採点者を得るためにデータセット、プロンプト、スクリプトをオープンソース化した。