Levent Bulut는 터키어 내러티브 코퍼스의 기계 생성 주석 신뢰성을 평가하기 위해 세 가지 연구로 구성된 벤치마크를 발표했으며, 자동 판독자와 인간 판단 간에 상당한 불일치를 드러냈습니다. 이 연구는 Gemini 2.5 Flash, Grok, ChatGPT 5.5, Claude Fable 5 High를 포함한 규칙 기반 감지기와 모델들을 사용하여 120개와 100개의 장면에서 여섯 가지 이항 공예 특성을 테스트했습니다.

  • Cohen의 카파 점수는 여섯 명의 판독자 중 다섯 명에게 무작위 수준에 가까웠으며, 0.000에서 0.027 사이였습니다.
  • 추상적 상태에 대한 추론이 필요한 규칙의 경우, 인간 판독자는 양성을 9개 식별한 반면 ChatGPT 5.5는 40개를, 감지기는 72개를 식별했습니다.
  • 여섯 가지 규칙 중 다섯 가지가 음성 레이블을 선호하는 편향된 분포를 보였기 때문에, ChatGPT 5.5는 84.5%의 가장 높은 원시 일치율을 달성했습니다.
  • 저자는 여섯 가지 규칙 중 네 가지가 모델 실패가 아닌 평가 세트의 결함으로 인해 사실상 테스트 불가능하다고 지적했습니다.

이 결과는 해당 특성이 현재 모델의 추론 범위를 벗어나거나, 정의가 일관된 적용을 위해 충분히 운영적이지 않음을 시사합니다. Bulut는 두 번째 독립적인 인간 판독자를 구하기 위해 데이터셋, 프롬프트 및 스크립트를 오픈소스로 공개했습니다.