Benchmark · agentic
SWE-bench Verified
जाँचता है कि कोई AI एजेंट असली GitHub issues को शुरू से अंत तक हल कर सकता है या नहीं। "Verified" सेट लोकप्रिय ओपन-सोर्स Python रिपॉज़िटरी से लिए गए 500 मानव-सत्यापित कार्य हैं।
और पढ़ें
- उदाहरण
- एक बग रिपोर्ट और रिपॉज़िटरी दिए जाने पर, मॉडल को एक कोड patch तैयार करना होता है — जैसे किसी विफल हो रही date-parsing फ़ंक्शन को ठीक करना ताकि प्रोजेक्ट का test suite पास हो जाए।
- स्कोरिंग
- हल किए गए issues का % — आमतौर पर pass@1 (एक प्रयास) के रूप में रिपोर्ट किया जाता है। अधिक बेहतर है।
- सत्यापन
- पूरी तरह स्वचालित: तैयार किया गया patch लगाया जाता है और प्रोजेक्ट के असली छिपे हुए unit tests एक sandbox में चलाए जाते हैं। कोई कार्य तभी गिना जाता है जब हर लक्ष्य test पास हो और कुछ भी regress न हो।
- यह क्यों मायने रखता है
- असली दुनिया के coding-agent बेंचमार्क में अग्रणी और हर frontier रिलीज़ में एक प्रमुख आँकड़ा; यहाँ की प्रगति यह दर्शाती है कि एजेंट स्वायत्त सॉफ़्टवेयर इंजीनियरिंग के कितने करीब हैं।
हल किया गया उदाहरण
कार्य
फ़िक्स्ड बेस commit पर रिपॉज़िटरी
django/django। बग रिपोर्ट: django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) '___this-is-a-test___' लौटाता है, लेकिन आगे/पीछे लगे underscores और hyphens हट जाने चाहिए ताकि परिणाम 'this-is-a-test' हो। मॉडल को केवल issue का टेक्स्ट और रिपॉज़िटरी दिया जाता है और उसे एक unified-diff patch आउटपुट करना होता है।समाधान
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
value = re.sub(r"[^\w\s-]", "", value.lower())
- return re.sub(r"[-\s]+", "-", value)
+ return re.sub(r"[-\s]+", "-", value).strip("-_")
व्याख्या
slugify आंतरिक separators को समेट देता है लेकिन आसपास के
-/_ को कभी नहीं काटता, इसलिए अंतिम re.sub में .strip("-_") जोड़ने से वे हट जाते हैं; patch न्यूनतम है और बाकी सारा व्यवहार बरकरार रखता है। SWE-bench Verified बेस commit पर रिपॉज़िटरी में patch लगाता है और छिपे हुए suite को चलाकर मूल्यांकन करता है — यह तभी पास होता है जब हर FAIL_TO_PASS test पास होने में बदल जाए और सभी PASS_TO_PASS tests हरे बने रहें।