نشر ليفنت بولوت معيارًا يتكون من ثلاث دراسات لتقييم موثوقية التسميات التي تولّدها الآلة لمجموعة سرديات تركية، وكشف عن تناقضات كبيرة بين المقيمين الآليين والحكم البشري. اختبرت الدراسة ست سمات حرفية ثنائية عبر 120 و100 مشهد باستخدام كاشفات قائمة على القواعد ونماذج بما في ذلك Gemini 2.5 Flash وGrok وChatGPT 5.5 وClaude Fable 5 High.
- كانت درجات كابا لكوهين قريبة من الصدفة بالنسبة لخمس من أصل ستة مقيّمين، تتراوح بين 0.000 و0.027.
- بالنسبة للقاعدة التي تتطلب الاستدلال على الحالات المجردة، حدد المقيّمون البشريون 9 حالات إيجابية بينما حدّد ChatGPT 5.5 أربعًا وحدّد الكاشف 72.
- حقّق ChatGPT 5.5 أعلى موافقة خام بنسبة 84.5٪، وذلك أساسًا لأن خمس القواعد الست كانت ذات توزيعات غير متوازنة تفضّل التسميات السلبية.
- يلاحظ المؤلف أن أربعًا من أصل ست قواعد كانت غير قابلة للاختبار فعليًا بسبب عيوب في مجموعة التقييم وليس بسبب فشل النماذج.
تشير النتائج إما إلى أن السمة تتطلب استدلالًا يتجاوز قدرات النماذج الحالية أو أن التعريف ليس عمليًا بما يكفي للتطبيق المتسق. وقد قام بولوت بنشر مجموعة البيانات والمطالبات والبرامج النصية مفتوحة المصدر للبحث عن مقيّم بشري مستقل ثانٍ.