Benchmark · coding

MBPP

saturated 3 परिणाम 3 मॉडल

MBPP (Mostly Basic Python Problems) एक कोड-जनरेशन बेंचमार्क है जिसमें सरल अंग्रेज़ी में वर्णित लगभग 1000 शुरुआती स्तर के Python प्रोग्रामिंग कार्य होते हैं, और हर कार्य के साथ स्वचालित टेस्ट केस जुड़े होते हैं। यह मापता है कि कोई मॉडल पहली ही कोशिश में कितनी बार सही function लिखता है, और इसे pass@1 मीट्रिक से बताया जाता है।

और पढ़ें
उदाहरण
एक सामान्य आइटम मॉडल से एक-पंक्ति के विवरण से एक छोटा Python function लिखने को कहता है — उदाहरण के लिए, «ऐसा function लिखें जो n-वाँ Fibonacci संख्या लौटाए» या «जाँचें कि कोई string palindrome है या नहीं» — जिसे फिर साथ दिए गए कुछ assert-आधारित टेस्ट पर चलाया जाता है।
स्कोरिंग
मीट्रिक pass@1 है: हर कार्य के लिए मॉडल एक हल बनाता है, और स्कोर उन कार्यों का अनुपात है जिनका उत्पन्न कोड उस कार्य के सभी टेस्ट केस पास कर देता है।
सत्यापन
हल को स्वचालित रूप से स्वीकार किया जाता है: उत्पन्न function को कार्य के assert-आधारित यूनिट टेस्ट पर चलाया जाता है और तभी सही गिना जाता है जब सभी टेस्ट पास हों (कोई मानव मूल्यांकन या सटीक-टेक्स्ट मिलान नहीं)।
यह क्यों मायने रखता है
MBPP बुनियादी Python कोड जनरेशन के लिए एक पुराना और आसानी से चलने वाला बेसलाइन है; चूँकि आज के मज़बूत मॉडल लगभग अधिकतम स्कोर पा लेते हैं, इसे संतृप्त (saturated) माना जाता है और अब यह शीर्ष सिस्टमों में फर्क करने के बजाय मुख्यतः एक सैनिटी जाँच के रूप में उपयोगी है।
हल किया गया उदाहरण
कार्य
MBPP-शैली का आइटम: «किसी दी गई lowercase string में स्वर अक्षरों (a, e, i, o, u) की संख्या गिनने के लिए एक python function लिखें।» इसके साथ तीन छिपे हुए assert टेस्ट आते हैं, जैसे assert count_vowels('hello') == 2, assert count_vowels('world') == 1, assert count_vowels('rhythm') == 0; function का नाम वही होना चाहिए जिसे टेस्ट कॉल करते हैं।
समाधान
def count_vowels(s):
    return sum(1 for ch in s if ch in 'aeiou')
व्याख्या
string पर जाकर 'aeiou' स्वर समुच्चय के अक्षरों को गिनने पर तीनों इनपुट के लिए क्रमशः 2, 1 और 0 मिलता है, इसलिए सभी assert पास हो जाते हैं। MBPP सभी तीन दिए गए assert टेस्ट पर उत्पन्न function को चलाकर समाधान को पास/फेल के रूप में आँकता है (कार्यात्मक शुद्धता, pass@k)।
0 19.5 39 58.5 78 2024-12-17 2025-10-01 2026-07-16 Falcon3-10B-Base · 73.8 · 2024-12-17 Qwen3.5-4B · 13 · 2026-07-13 Granite 4.0 3B · 63.2 · 2026-07-16
Falcon3-10B-Base Qwen3.5-4B Granite 4.0 3B
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-16 Granite 4.0 3B 63.2% IBM ने उच्च-गुणवत्ता वाले कोड के विशाल संश्लेषित डेटासेट CodeAlchemy को ओपन-सोर्स किया
2026-07-13 Qwen3.5-4B 13.0% फ्लिंट सटीकता बनाए रखते हुए टोकन उपयोग कम करने के लिए तर्क ट्रेस को संकुचित करता है
2024-12-17 Falcon3-10B-Base 73.8% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए