تختبر دراسة تستخدم EvalAwareBench ما إذا كانت النماذج اللغوية تستخدم اتجاهاً مشتركاً واحداً أو كواشف متعددة محددة بالإشارات لتحديد سياقات التقييم. قمت الأبحاث بتبديل ثمانية عوامل محفزة بشكل مستقل عبر 1,298 مطالبة مع تثبيت المهام والكيانات الأساسية.

  • يكشف تحليل نماذج Qwen3 (0.6B–14B) وGemma 3 (270M/1B) أن الاتجاهات الخاصة بكل إشارة تقع عند حوالي 20% فقط من السقف القابل للقياس لموثوقية جيب التمام، مما يشير إلى كواشف مميزة بدلاً من محور مشترك واحد.
  • يُعد الإفصاح الصريح عن التقييم المحرك الأساسي، مع تشابه جيب تمام يبلغ حوالي 0.89 بالنسبة للاتجاه العالمي؛ وإزالته وحدها تكلف 36–57% من إشارة التقييم/النشر.
  • تقرأ اصطناعية المثير عند مستوى الصدفة (AUROC 0.52) على الاتجاه العالمي، رغم أن النموذج يمثلها في مكان آخر باتجاه مخصص يبلغ 0.68.
  • لا يحسن إطار التقييم القدرة ولكنه يغير الاستعداد للإجابة بشكل كبير، مع تحول متوسط اللوغاريتم الاحتمالي لأعلى حرف من -16.68 في النشر إلى -3.90 في التقييم عند 14B.

تشير النتائج إلى أن وعي التقييم هو حزمة من الكواشف الخاصة بالإشارة بدلاً من محور عالمي واحد، مع كون الإفصاح الصريح هو العامل المهيمن.