एजेंट वेस्ट इंडेक्स ने दक्षताहीनताओं जैसे लूप, अंधेरे पुनः प्रयासों, अत्यधिक बड़े टूल आउटपुट और छोड़ दिए गए रन की पहचान करने के लिए 11 सार्वजनिक डेटासेट से 341,054 एजेंट ट्रैजेक्टरी का स्कोर दिया है। विश्लेषण से पता चलता है कि लूप और पुनः प्रयास व्यवहार Llama जैसे कमजोर मॉडल्स में व्यापक हैं, लेकिन Claude 3.7 Sonnet और Qwen3-Coder-480B में दुर्लभ हैं।
- अत्यधिक बड़े टूल आउटपुट स्केफोल्ड के आधार पर काफी भिन्न होते हैं, जिसमें OpenHands और SWE-agent आधे से अधिक रन में 20k-अक्षर से अधिक अवलोकन धारण करते हैं।
- चरण गणना के आधार पर सबसे लंबे पांचवें हिस्से के रन अनुमानित खर्च का 40% लेते हैं, जबकि वे सबसे छोटे पांचवें हिस्से की तुलना में कम दर पर हल होते हैं।
- परियोजना हब से इंडेक्स को पुनः बनाने के लिए एक पाइपलाइन और डिटेक्टर प्रदान करती है, जिसके लिए सार्वजनिक तालिकाएं समुदाय की जांच के लिए ऑनलाइन उपलब्ध हैं।
लेखकों ने डेटासेट प्रकाशकों के लिए सुधार तंत्र प्रदान किए हैं और कोडिंग एजेंट प्रदर्शन में पारदर्शिता बढ़ाने का लक्ष्य रखा है।