Benchmark · agentic

SWE-Lancer

4 परिणाम 4 मॉडल

SWE-Lancer, Upwork से लिए गए 1488 वास्तविक फ्रीलांस सॉफ़्टवेयर-इंजीनियरिंग कार्यों का एक बेंचमार्क है, जिनका वास्तविक भुगतान कुल 10 लाख डॉलर (USD) है; यह मापता है कि इन्हें पूरी तरह हल करके कोई मॉडल इस राशि में से कितना «कमा» सकता है, और स्कोर कुल कमाए गए USD (और हल किए गए कार्यों के अनुपात) के रूप में दिया जाता है।

और पढ़ें
उदाहरण
फ्रीलांस-शैली का एक बग-फिक्स कार्य: एक वास्तविक (GitHub-शैली के) issue और ऐप के पूरे repository को देखते हुए, मॉडल को एक patch बनाना होता है जो टूटे हुए यूज़र फ़्लो को फिर से काम करने लायक बना दे (उदाहरण के लिए बिल बाँटने या भुगतान की स्क्रीन), जिसे end-to-end टेस्ट से जाँचा जाता है। दूसरी धारा प्रबंधन कार्य देती है: कई इंजीनियरिंग प्रस्तावों में से सबसे अच्छा चुनना।
स्कोरिंग
हर कार्य के साथ वह वास्तविक USD कीमत जुड़ी होती है जो Upwork पर उसके लिए चुकाई गई थी (लगभग 50 से 32,000 डॉलर तक)। कोई मॉडल किसी कार्य की पूरी कीमत तभी कमाता है जब उसका समाधान पास हो जाए — एक कार्य के भीतर आंशिक अंक नहीं मिलते। मुख्य मीट्रिक 10 लाख डॉलर के पूल में से कमाए गए कुल डॉलर हैं, साथ ही हल किए गए कार्यों का प्रतिशत; दोनों धाराएँ (IC कोडिंग और प्रबंधन) अलग-अलग भी रिपोर्ट की जाती हैं।
सत्यापन
कोडिंग (IC) कार्यों का मूल्यांकन end-to-end टेस्ट (Playwright) से होता है, जो वास्तविक यूज़र क्रियाओं का अनुकरण करते हैं, पेशेवर इंजीनियरों द्वारा लिखे और सत्यापित किए गए होते हैं और एक अलग-थलग Docker वातावरण में चलते हैं; मॉडल के patch को कार्य के सभी टेस्ट पास करने होते हैं, और मॉडल उन्हें न देख सकता है और न बदल सकता है। प्रबंधन कार्य तब स्वीकार होते हैं जब मॉडल वही प्रस्ताव चुने जो असल में नियुक्त करने वाले मैनेजर ने चुना था।
यह क्यों मायने रखता है
यह मॉडल के प्रदर्शन को एक वास्तविक प्रोडक्शन कोडबेस पर, बाज़ार द्वारा तय कीमत वाले, आर्थिक रूप से वास्तविक काम से जोड़ता है, न कि कृत्रिम या स्व-मूल्यांकित समस्याओं से। चूँकि मूल्यांकन पूरे end-to-end यूज़र फ़्लो का उपयोग करता है (अलग-थलग फ़ंक्शन-स्तरीय सुधार नहीं) और साथ में एक प्रबंधन-निर्णय धारा भी है, यह जाँचता है कि अग्रणी मॉडल वह पूर्ण, मूल्यवान इंजीनियरिंग कर सकते हैं या नहीं जिसके लिए लोग सचमुच फ्रीलांसरों को भुगतान करते हैं।
हल किया गया उदाहरण
कार्य
IC SWE कार्य (उदाहरणस्वरूप, ~$250): जब कोई राशि टाइप करने से पहले किसी प्रतिभागी को हटा दिया जाता है, तो ऐप की «Split Bill» स्क्रीन कुल योग NaN दिखाती है। पूरे repository वाले एक Docker कंटेनर में काम करते हुए, बग को ठीक करें ताकि दिखाया गया कुल योग वापस $0.00 पर आ जाए; एक छिपा हुआ end-to-end टेस्ट इसी यूज़र फ़्लो को दोहराता है।
समाधान
```diff
 function getSplitTotal(amounts) {
-  return amounts.reduce((sum, a) => sum + a.value, 0);
+  return amounts.reduce((sum, a) => sum + (Number(a?.value) || 0), 0);
 }
```
व्याख्या
किसी प्रतिभागी को हटाने से एक ऐसी entry बच जाती है जिसका value undefined होता है, इसलिए a.value चालू योग को NaN बना देता है; हर मान को Number(...) || 0 से बदलने पर गायब राशि छूट जाती है और कुल योग $0.00 के रूप में दिखता है। मूल्यांकन बाइनरी है — patch को कार्य की पूरी USD कीमत तभी मिलती है जब वह उस कार्य के हर end-to-end टेस्ट को पास करे, जो वास्तविक यूज़र फ़्लो पर चलाए जाते हैं।
0 19 38 57 76 2025-03-05 2025-12-17 2026-09-30 GPT-4.5 · 32.6 · 2025-03-05 SkillGym-Agent · 51.5 · 2026-09-24 GPT-5.5 · 71.5 · 2026-09-30 Claude Opus 4.8 · 67.2 · 2026-09-30
GPT-4.5 SkillGym-Agent GPT-5.5 Claude Opus 4.8
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-30 GPT-5.5 71.5% एजेंटिक मेटा-रिज़निंग स्पष्ट नियंत्रण के माध्यम से निष्कर्ष को स्केल करता है
2026-09-30 Claude Opus 4.8 67.2% एजेंटिक मेटा-रिज़निंग स्पष्ट नियंत्रण के माध्यम से निष्कर्ष को स्केल करता है
2026-09-24 SkillGym-Agent 51.47% SkillGym मानवीय कौशल को LLMs में एकीकृत करता है ताकि वास्तविक दुनिया की समस्याओं का समाधान किया जा सके
2025-03-05 GPT-4.5 32.6% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया