Исследователь просит одного независимого человеческого аннотатора разметить 100 турецких нарративных сцен, чтобы определить, обусловлено ли низкое межрейтерское согласие интерпретационной природой задачи или нечёткими определениями аннотации. Исследование показало, что четыре LLM и детектор на основе правил согласовывались друг с другом и человеческим эталоном примерно на уровне случайного угадывания, при этом значения κ Коэна варьировались от 0.000 до 0.185.
- Корпус состоит из 100 двуязычных турецко-английских сцен, размеченных по шести ремесленным признакам, включая материализованную метафору.
- Пять машинных аннотаторов оценивались по зафиксированному набору человеческих эталонных меток, содержащему 9 положительных примеров из 100.
- Сырое согласие между пятью аннотаторами составило 74.7%–86.3%, но это вводит в заблуждение из-за экстремального распределения классов и парадокса каппы.
- Исследователь проводит различие между двумя возможными объяснениями: признак по своей природе интерпретационен, либо определение ясно для автора, но недостаточно определено для других.
Результаты будут опубликованы независимо от исхода, что даст содержательный вывод о том, можно ли делегировать такие признаки машинам или требуются более чёткие человеческие руководства.