قام فهرس هدر الوكلاء بتقييم 341,054 مسارًا للوكيل من 11 مجموعة بيانات عامة لتحديد عدم الكفاءة مثل الحلقات، وإعادة المحاولة العمياء، وإخراج الأدوات الضخم، والتشغيلات المهجورة. يكشف التحليل أن سلوكيات الحلقة وإعادة المحاولة شائعة في النماذج الأضعف مثل وكلاء Llama لكنها نادرة في Claude 3.7 Sonnet و Qwen3-Coder-480B.

  • يختلف إخراج الأدوات الضخم بشكل كبير حسب الهيكل، حيث تحمل OpenHands و SWE-agent ملاحظات تزيد عن 20 ألف حرف في أكثر من نصف التشغيلات.
  • تستهلك أطول خمس تشغيلات من حيث عدد الخطوات 40% من الإنفاق المقدر بينما تحل بمعدل أقل من أقصر خمس تشغيلات.
  • يوفر المشروع خط أنابيب وكاشفات لإعادة بناء الفهرس من المستودع، مع جداول متاحة عبر الإنترنت للتحقق المجتمعي.

يقدم المؤلفون آليات تصحيح لنشري مجموعات البيانات ويهدفون إلى تحسين الشفافية في أداء وكلاء البرمجة.