Benchmark · coding
MBPP+
MBPP+, कोडिंग बेंचमार्क MBPP (Mostly Basic Python Problems) का कठोरता से टेस्ट-विस्तारित संस्करण है, जो EvalPlus फ्रेमवर्क से बनाया गया है। यह मॉडल द्वारा जनरेट किए गए Python फ़ंक्शन की कार्यात्मक शुद्धता मापता है और pass@1 के रूप में रिपोर्ट किया जाता है।
और पढ़ें
- उदाहरण
- एक सामान्य आइटम में लिखने के लिए किसी बुनियादी Python फ़ंक्शन का संक्षिप्त प्राकृतिक-भाषा विवरण होता है (उदाहरण के लिए, «दो सूचियों के साझा तत्व खोजें»), साथ में कुछ उदाहरण assertions होते हैं जो अपेक्षित व्यवहार तय करते हैं।
- स्कोरिंग
- मापदंड pass@k है, आमतौर पर pass@1: कोई कार्य तभी हल माना जाता है जब जनरेट किया गया फ़ंक्शन सभी टेस्ट पास कर ले; स्कोर हल किए गए कार्यों का प्रतिशत है। pass@k की गणना n नमूना पूर्णताओं पर मानक निष्पक्ष अनुमानक से की जाती है।
- सत्यापन
- प्रत्येक उम्मीदवार फ़ंक्शन को सैंडबॉक्स में पूरे सेट के विरुद्ध चलाया जाता है — मूल MBPP assertions के साथ EvalPlus द्वारा स्वचालित रूप से जनरेट किए गए इनपुट (टाइप-सजग म्यूटेशन और LLM सीडिंग, MBPP की तुलना में लगभग 35 गुना अधिक टेस्ट)। किसी कार्य के लिए इसे तभी स्वीकार किया जाता है जब यह समय-सीमा के भीतर सभी टेस्ट पास कर ले।
- यह क्यों मायने रखता है
- मूल MBPP में प्रति समस्या केवल लगभग तीन टेस्ट होते हैं, इसलिए सूक्ष्म रूप से गलत कोड झूठे-सकारात्मक के रूप में निकल सकता है। MBPP+ मूल्यांकन को कठोर बनाता है, ताकि प्रकाशित पास दरें और मॉडल रैंकिंग कमजोर परीक्षण के बजाय वास्तविक शुद्धता दर्शाएँ।
हल किया गया उदाहरण
कार्य
एक फ़ंक्शन लिखें जो दो दी गई सूचियों के साझा तत्व खोजे और उन्हें अद्वितीय मानों की क्रमबद्ध सूची के रूप में लौटाए। आपका कोड इस तरह के टेस्ट पास करना चाहिए: assert shared_elements([1, 2, 3, 4], [3, 4, 5, 6]) == [3, 4]
समाधान
```python
def shared_elements(list1, list2):
return sorted(set(list1) & set(list2))
```
व्याख्या
दोनों सूचियों को समुच्चय के रूप में प्रतिच्छेदन करना और क्रमबद्ध करना क्रम में अद्वितीय साझा मान देता है, जो assertions को संतुष्ट करता है। MBPP+ कई अतिरिक्त इनपुट भी चलाता है (खाली सूचियाँ, डुप्लिकेट, बड़े मामले); pass@1 ग्रेडिंग में, समाधान तभी गिना जाता है जब वह सभी पास कर ले।
इस benchmark के लिए अभी तक कोई सत्यापित स्कोर रिपोर्ट नहीं किया गया है।