OpenAI ने SWE-bench Verified जारी किया है, जो SWE-bench बेंचमार्क का एक मानव-सत्यापित उपसमुच्चय है, जिसे वास्तविक दुनिया के सॉफ़्टवेयर मुद्दों को हल करने में AI मॉडलों की क्षमता का अधिक विश्वसनीय आकलन करने के लिए डिज़ाइन किया गया है। यह नया संस्करण SWE-bench और SWE-bench Lite टेस्ट सेट्स को प्रतिस्थापित करता है, जिसने उन दोषों को दूर किया है जो पहले मॉडल क्षमताओं के अनुमान को कम करने का कारण बनते थे।
रिलीज़ में पेशेवर डेवलपर्स द्वारा सत्यापित 500 नमूने शामिल हैं, ताकि अच्छी तरह से निर्दिष्ट मुद्दे की विवरण और उचित सीमा वाले यूनिट टेस्ट सुनिश्चित किए जा सकें। यह सभी 1,699 नमूना टेस्ट आइटम के लिए एनोटेशन भी प्रदान करता है, जिससे कठिनाई को 'आसान' (196 कार्य) और 'कठिन' (45 कार्य) उपसमुच्चयों में विभाजित किया जा सकता है। इसके अलावा, सेटअप की विश्वसनीयता में सुधार के लिए कंटेनराइज़्ड Docker वातावरण का उपयोग करने वाला एक नया मूल्यांकन हार्नेस भी जारी किया गया है।
SWE-bench Verified पर, GPT-4o 33.2% नमूनों को हल करता है, जबकि सर्वश्रेष्ठ ओपन-सोर्स स्काफोल्ड, Agentless, अपने पिछले स्कोर को दोगुना करके 16% तक पहुँचता है।