Benchmark · coding
MBPP
MBPP (Mostly Basic Python Problems) एक कोड-जनरेशन बेंचमार्क है जिसमें सरल अंग्रेज़ी में वर्णित लगभग 1000 शुरुआती स्तर के Python प्रोग्रामिंग कार्य होते हैं, और हर कार्य के साथ स्वचालित टेस्ट केस जुड़े होते हैं। यह मापता है कि कोई मॉडल पहली ही कोशिश में कितनी बार सही function लिखता है, और इसे pass@1 मीट्रिक से बताया जाता है।
और पढ़ें
- उदाहरण
- एक सामान्य आइटम मॉडल से एक-पंक्ति के विवरण से एक छोटा Python function लिखने को कहता है — उदाहरण के लिए, «ऐसा function लिखें जो n-वाँ Fibonacci संख्या लौटाए» या «जाँचें कि कोई string palindrome है या नहीं» — जिसे फिर साथ दिए गए कुछ assert-आधारित टेस्ट पर चलाया जाता है।
- स्कोरिंग
- मीट्रिक pass@1 है: हर कार्य के लिए मॉडल एक हल बनाता है, और स्कोर उन कार्यों का अनुपात है जिनका उत्पन्न कोड उस कार्य के सभी टेस्ट केस पास कर देता है।
- सत्यापन
- हल को स्वचालित रूप से स्वीकार किया जाता है: उत्पन्न function को कार्य के assert-आधारित यूनिट टेस्ट पर चलाया जाता है और तभी सही गिना जाता है जब सभी टेस्ट पास हों (कोई मानव मूल्यांकन या सटीक-टेक्स्ट मिलान नहीं)।
- यह क्यों मायने रखता है
- MBPP बुनियादी Python कोड जनरेशन के लिए एक पुराना और आसानी से चलने वाला बेसलाइन है; चूँकि आज के मज़बूत मॉडल लगभग अधिकतम स्कोर पा लेते हैं, इसे संतृप्त (saturated) माना जाता है और अब यह शीर्ष सिस्टमों में फर्क करने के बजाय मुख्यतः एक सैनिटी जाँच के रूप में उपयोगी है।
हल किया गया उदाहरण
कार्य
MBPP-शैली का आइटम: «किसी दी गई lowercase string में स्वर अक्षरों (a, e, i, o, u) की संख्या गिनने के लिए एक python function लिखें।» इसके साथ तीन छिपे हुए assert टेस्ट आते हैं, जैसे
assert count_vowels('hello') == 2, assert count_vowels('world') == 1, assert count_vowels('rhythm') == 0; function का नाम वही होना चाहिए जिसे टेस्ट कॉल करते हैं।समाधान
def count_vowels(s):
return sum(1 for ch in s if ch in 'aeiou')
व्याख्या
string पर जाकर 'aeiou' स्वर समुच्चय के अक्षरों को गिनने पर तीनों इनपुट के लिए क्रमशः 2, 1 और 0 मिलता है, इसलिए सभी assert पास हो जाते हैं। MBPP सभी तीन दिए गए assert टेस्ट पर उत्पन्न function को चलाकर समाधान को पास/फेल के रूप में आँकता है (कार्यात्मक शुद्धता, pass@k)।
| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2026-07-16 | Granite 4.0 3B | 63.2% | IBM ने उच्च-गुणवत्ता वाले कोड के विशाल संश्लेषित डेटासेट CodeAlchemy को ओपन-सोर्स किया |
| 2026-07-13 | Qwen3.5-4B | 13.0% | फ्लिंट सटीकता बनाए रखते हुए टोकन उपयोग कम करने के लिए तर्क ट्रेस को संकुचित करता है |
| 2024-12-17 | Falcon3-10B-Base | 73.8% | Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए |