एक शोधकर्ता 100 तुर्की कथात्मक दृश्यों को लेबल करने के लिए एक एकल स्वतंत्र मानव टिप्पणीकार का अनुरोध कर रहे हैं ताकि यह निर्धारित किया जा सके कि कम इंटर-रेटर सहमति कार्य की व्याख्यात्मक प्रकृति से उत्पन्न होती है या अधूरी टिप्पणी परिभाषाओं से। अध्ययन में पाया गया कि चार LLMs और एक नियम-आधारित डिटेक्टर एक-दूसरे और मानव संदर्भ के साथ लगभग संयोग स्तर पर सहमत थे, जिसमें Cohen’s κ स्कोर 0.000 से 0.185 तक थे।
- कॉर्पस में छह शिल्प विशेषताओं के लिए टिप्पणी किए गए 100 द्विभाषी तुर्की–अंग्रेजी दृश्य शामिल हैं, जिनमें मेटाफोर का प्रकटीकरण भी शामिल है।
- पांच मशीन रेटर्स ने 100 में से 9 सकारात्मक वाले स्थिर मानव संदर्भ लेबल सेट के खिलाफ स्कोर किया।
- पांच रेटर्स के बीच कच्ची सहमति 74.7%–86.3% थी, लेकिन यह अत्यधिक वर्ग वितरण और काप्पा विरोधाभास के कारण भ्रामक है।
- शोधकर्ता दो संभावित व्याख्याओं के बीच अंतर करते हैं: विशेषता स्वयं ही व्याख्यात्मक है, या परिभाषा लेखक के लिए स्पष्ट है लेकिन अन्य लोगों के लिए अधूरी है।
परिणाम चाहे जो भी हो, प्रकाशित किया जाएगा, जिससे यह पता चलेगा कि क्या ऐसे विशेषताओं को मशीनों को सौंपा जा सकता है या क्या उन्हें स्पष्ट मानव दिशा-निर्देशों की आवश्यकता है।