يطلب باحث مُعلِّماً بشرياً مستقلاً واحداً لتصنيف 100 مشهد سردي تركي لتحديد ما إذا كان انخفاض اتفاق المقيّمين يعود إلى الطبيعة التفسيرية للمهمة أو إلى تعريفات التضمين غير المحددة بدقة. وجدت الدراسة أن أربعة نماذج لغات كبيرة وكاشفاً قائماً على القواعد اتفق مع بعضها البعض ومع المرجع البشري عند مستوى يقارب الصدفة العشوائية، حيث تراوحت درجات كوهن κ بين 0.000 و0.185.
- يتكون المجموعة النصية من 100 مشهد ثنائي اللغة (تركي-إنجليزي) مُعلَّم لستة سمات حرفية، بما في ذلك الاستعارة المجسَّدة.
- قيّم خمسة مقيّمين آليين بناءً على مجموعة ثابتة من التسميات المرجعية البشرية التي تحتوي على 9 إيجابيات من أصل 100.
- كان الاتفاق الخام بين المقيّمين الخمسة يتراوح بين 74.7% و86.3٪، لكن هذا مضلّل بسبب التوزيع الفئوي المتطرف ومتلازمة كابا.
- يميّز الباحث بين تفسيرين محتملين: أن السمة ذات طبيعة تفسيرية جوهرياً، أو أن التعريف واضح للمؤلف لكنه غير مُحدَّد بشكل كافٍ للآخرين.
سيتم نشر النتيجة بغض النظر عن مخرجاتها، مما يوفر findingاً جوهرياً حول ما إذا كانت هذه السمات يمكن تفويضها إلى الآلات أم تتطلب إرشادات بشرية أكثر وضوحاً.