पत्र में SWE-bench का परिचय दिया गया है, एक मूल्यांकन फ्रेमवर्क जो वास्तविक सॉफ्टवेयर इंजीनियरिंग कार्यों पर भाषा मॉडल की क्षमताओं को परखने के लिए डिज़ाइन किया गया है। इसमें 12 लोकप्रिय Python रिपॉजिटरी में वास्तविक GitHub मुद्दों और पुल अनुरोधों से लिए गए 2,294 समस्याएं शामिल हैं।

  • बेंचमार्क को मॉडल को विशिष्ट मुद्दों को हल करने के लिए कोडबेस को संपादित करने की आवश्यकता होती है, जिसमें अक्सर कई फ़ंक्शन, कक्षाओं और फ़ाइलों के बीच समन्वय शामिल होता है।
  • मॉडल को निष्पादन वातावरण के साथ इंटरैक्ट करना, अत्यंत लंबे संदर्भों को प्रोसेस करना और पारंपरिक कोड जनरेशन से परे जटिल तर्क करना होगा।
  • मूल्यांकन दिखाते हैं कि यहां तक कि सबसे उन्नत स्वामित्व वाले मॉडल भी काफी संघर्ष करते हैं; सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल, Claude 2, ने केवल 1.96% मुद्दों को हल किया।
  • फाइन-ट्यूंड मॉडल SWE-Llama ने भी डेटासेट में केवल सबसे सरल मुद्दों को ही हल किया।

SWE-bench पर प्रगति को वास्तविक दुनिया के परिदृश्यों में भाषा मॉडलों को अधिक व्यावहारिक, बुद्धिमान और स्वतंत्र बनाने की ओर कदम माना जाता है।