Левент Булут опубликовал бенчмарк из трёх исследований, оценивающий надёжность машинно-сгенерированных аннотаций для турецкого нарративного корпуса, выявив значительные расхождения между автоматическими оценщиками и человеческим суждением. В исследовании проверялись шесть бинарных ремесленных признаков на 120 и 100 сценах с использованием детекторов на основе правил и моделей, включая Gemini 2.5 Flash, Grok, ChatGPT 5.5 и Claude Fable 5 High.
- Коэффициенты каппы Коэна были близки к случайным для пяти из шести оценщиков, варьируясь от 0.000 до 0.027.
- Для правила, требующего вывода о абстрактных состояниях, человеческие оценщики выявили 9 положительных случаев, ChatGPT 5.5 — 40, а детектор — 72.
- ChatGPT 5.5 достиг наивысшего сырого согласия в 84.5%, главным образом потому, что пять из шести правил имели перекос в распределении в пользу отрицательных меток.
- Автор отмечает, что четыре из шести правил были фактически непроверяемыми из-за дефектов набора для оценки, а не из-за сбоев моделей.
Результаты указывают либо на то, что признак требует вывода за пределами возможностей текущих моделей, либо на то, что определение недостаточно операционализировано для последовательного применения. Булут открыл исходный код датасета, промптов и скриптов в поисках второго независимого человеческого оценщика.