أطلقت مايكروسوفت وHugging Face ThinkingBox، وهو معيار يقيم وكلاء الذكاء الاصطناعي من خلال تقييم تأثيرهم على حالات قواعد البيانات المعزولة بدلاً من مجرد استدعاءات الأدوات أو الاستجابات النهائية. عبر 507 سير عمل تجاري ذي حالة مُنفَّذ 20 مرة لكل منها ضد نماذج LLM متنوعة، وجدت الدراسة أنه بينما ينتج العديد من الوكلاء استدعاءات أدوات صحيحة، إلا أنهم يتركون في كثير من الأحيان قيمًا خاطئة، أو آثارًا جانبية غير مقصودة، أو آثارًا مطلوبة مفقودة في الخلفية.
- يتصدر Claude Opus 5.5 القائمة العامة بنتيجة pass@1 تبلغ 67.16%، ولكن ثلاثة نماذج فقط تحتفظ بمعظم نتائج محاولتها الأولى عبر التكرارات الـ20: GPT-6 Astra (78%)، وClaude Opus 5.5 (71%)، وClaude Opus 5 (71%).
- يحل Kimi-K3 أوسع تغطية للمهام (93.89% مرة واحدة على الأقل) لكنه من أقل النماذج اتساقًا، حيث نجح في جميع المحاولات الـ20 فقط لـ13.41% من المهام.
- يوفر GPT-5.6 Sol أدنى تكلفة لكل محاولة ناجحة للمهمة عند 0.127 دولار، بينما يعد GPT-5.4 الخيار الأرخص الموثوق بتكلفة 6.80 دولار لكل مهمة مُنجزة عبر المحاولات الـ20.
- تُعزى حوالي أربع من كل خمس فشل إلى مشاكل في التعامل مع الأدوات، مثل عدم القدرة على التعافي من الأخطاء أو عمليات البحث الفارغة، بدلاً من عجز في الاستدلال.
يجادل المؤلفون بأن نتائج pass@1 وحدها غير كافية لموثوقية النشر، ويوصون بمعاملة معدل الاتساق 20/20 كمدخل تصميمي، والتحقق من الحالة الطرفية قبل الالتزام بالتغييرات في بيئة الإنتاج.