قدم الباحثون "إرشادات الاتساق" ضمن نظام ALTK-Evolve، وهي آلية جديدة مصممة لمعالجة التباين في أداء وكلاء نماذج اللغات الكبيرة (LLM) الذي غالباً ما تخفيه مقاييس الدقة المتوسطة القياسية. من خلال تحديد نقاط القرار المعرضة للقلب واستقرارها، يحسن هذا النهج بشكل كبير اتساق نجاح المهام دون المساس بالقدرة الإجمالية.

  • يكشف محلل الاتساق الخطوات "المعرضة للقلب" عن طريق إعادة أخذ العينات لمسار واحد مسجل مع k=5 إكمالات، ولا يتطلب حقيقة أرضية أو إعادة تشغيل من البداية للنهاية.
  • على اختبار AppWorld test_normal باستخدام وكيل ReAct المعتمد على GPT-4.1، قللت إرشادات الاتساق فجوة الاتساق (Mean@5 ناقص Pass^5) من 24.4 نقطة مئوية إلى 12.0 نقطة مئوية.
  • ارتفع متوسط Pass^5 التراكمي من 53.0% إلى 69.0%، بينما زاد Mean@5 قليلاً من 77.4% إلى 81.0%، مع الحفاظ على الدقة المتوسطة.
  • تعمم الطريقة على المهام المشابهة، مما يرفع Pass^5 بمقدار 13.0 نقطة مئوية، وتظهر مكاسب قابلة للنقل على النماذج الأضعف مثل gpt-oss-120b.

تسلط هذه الدراسة الضوء على أن الاتساق يمثل بُعداً مستقلاً عن القدرة، مما يدفع المطورين إلى الإبلاغ عن Pass^k جنباً إلى جنب مع Mean@k لتقييم موثوقية الوكلاء بشكل أفضل في بيئات الإنتاج.