Исследователь просит одного независимого человеческого аннотатора разметить 100 турецких нарративных сцен, чтобы определить, обусловлено ли низкое межрейтерское согласие интерпретационной природой задачи или нечёткими определениями аннотации. Исследование показало, что четыре LLM и детектор на основе правил согласовывались друг с другом и человеческим эталоном примерно на уровне случайного угадывания, при этом значения κ Коэна варьировались от 0.000 до 0.185.

  • Корпус состоит из 100 двуязычных турецко-английских сцен, размеченных по шести ремесленным признакам, включая материализованную метафору.
  • Пять машинных аннотаторов оценивались по зафиксированному набору человеческих эталонных меток, содержащему 9 положительных примеров из 100.
  • Сырое согласие между пятью аннотаторами составило 74.7%–86.3%, но это вводит в заблуждение из-за экстремального распределения классов и парадокса каппы.
  • Исследователь проводит различие между двумя возможными объяснениями: признак по своей природе интерпретационен, либо определение ясно для автора, но недостаточно определено для других.

Результаты будут опубликованы независимо от исхода, что даст содержательный вывод о том, можно ли делегировать такие признаки машинам или требуются более чёткие человеческие руководства.