लेवेंट बुलुट ने तुर्की कथा संकलन के लिए मशीन-जनित टिप्पणियों की विश्वसनीयता का मूल्यांकन करने वाले तीन अध्ययनों वाला एक बेंचमार्क प्रकाशित किया, जिसमें स्वचालित रेटर्स और मानव निर्णय के बीच महत्वपूर्ण असंगतियां सामने आईं। इस अध्ययन ने नियम-आधारित डिटेक्टरों और Gemini 2.5 Flash, Grok, ChatGPT 5.5, और Claude Fable 5 High जैसे मॉडल का उपयोग करके 120 और 100 दृश्यों में छह द्विआधारी कला विशेषताओं का परीक्षण किया।
- कोहेन का कप्पा स्कोर छह लेबलर्स में से पांच के लिए संयोग के पास था, जो 0.000 से 0.027 तक था।
- अमूर्त अवस्थाओं पर अनुमान लगाने वाले नियम के लिए, मानव रेटर्स ने 9 सकारात्मक पहचाने जबकि ChatGPT 5.5 ने 40 और डिटेक्टर ने 72 की पहचान की।
- ChatGPT 5.5 ने 84.5% का उच्चतम कच्चा सहमति हासिल किया, मुख्य रूप से इसलिए क्योंकि छह नियमों में से पांच के लिए वितरण असमान था जो नकारात्मक लेबल को पक्षपाती बनाता है।
- लेखक ने नोट किया कि मूल्यांकन सेट की दोषों के कारण छह नियमों में से चार प्रभावी रूप से अ परीक्षण योग्य थे, न कि मॉडल विफलताओं के कारण।
परिणाम सुझाव देते हैं या तो कि विशेषता को वर्तमान मॉडलों की परे अनुमान की आवश्यकता है या परिभाषा निरंतर लागू करने के लिए पर्याप्त रूप से संचालनीय नहीं है। बुलुट ने एक दूसरे स्वतंत्र मानव रेटर्स की तलाश में डेटासेट, प्रॉम्प्ट्स और स्क्रिप्ट को ओपन-सोर्स किया है।