Benchmark · coding
HumanEval
HumanEval मापता है कि कोई मॉडल प्राकृतिक भाषा में दिए गए विवरण से सही Python कोड लिखने में कितना सक्षम है; इसका स्कोर pass@1 से मिलता है, यानी पहली ही कोशिश में हल किए गए प्रश्नों का अनुपात।
और पढ़ें
- उदाहरण
- एक सामान्य प्रश्न में फ़ंक्शन का signature और उसकी docstring दी होती है — जैसे «n से छोटी सभी अभाज्य संख्याओं की सूची लौटाएँ» — और मॉडल को फ़ंक्शन का body पूरा करना होता है।
- स्कोरिंग
- मीट्रिक pass@1 है: हर उत्पन्न हल को छिपे हुए unit टेस्ट पर चलाया जाता है, और स्कोर उन 164 प्रश्नों का प्रतिशत है जिनका हल अपने सभी टेस्ट पास कर लेता है।
- सत्यापन
- पूरी तरह स्वचालित: कोई हल तभी सही गिना जाता है जब वह उस प्रश्न के सभी छिपे हुए unit टेस्ट पास कर ले; न कोई मानवीय आकलन, न स्ट्रिंग का सटीक मिलान।
- यह क्यों मायने रखता है
- यह व्यापक रूप से इस्तेमाल होने वाले पहले कोड-जनरेशन बेंचमार्क में से एक था और प्रोग्रामिंग क्षमता का मानक संदर्भ बन गया, हालाँकि अब शीर्ष मॉडल इस पर इतना ऊँचा स्कोर करते हैं कि यह लगभग संतृप्त हो चुका है और उनमें मुश्किल से ही अंतर कर पाता है।
हल किया गया उदाहरण
कार्य
इस Python फ़ंक्शन का बॉडी पूरा करें ताकि यह छिपे हुए unit tests पास कर सके:
```python
from typing import List
def below_zero(operations: List[int]) -> bool:
"""You're given a list of deposit and withdrawal operations on a bank account starting at zero balance. Detect whether the balance ever drops below zero and return True at that point; otherwise return False.
>>> below_zero([1, 2, 3])
False
>>> below_zero([1, 2, -4, 5])
True
"""
```
समाधान
from typing import List
def below_zero(operations: List[int]) -> bool:
balance = 0
for op in operations:
balance += op
if balance < 0:
return True
return False
व्याख्या
एक चालू balance रखें, हर operation को क्रम में जोड़ें, और जैसे ही यह शून्य से नीचे जाए True लौटाएँ; अगर loop पूरा हो जाए तो balance कभी ऋणात्मक नहीं हुआ, इसलिए False लौटाएँ। HumanEval मूल्यांकन इस तरह करता है: model के completion को prompt के साथ जोड़कर छिपे हुए unit tests पर चलाता है (pass@k) — item तभी हल माना जाता है जब सभी assert पास हों।
| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2026-07-16 | Granite 4.0 3B | 83.5% | IBM ने उच्च-गुणवत्ता वाले कोड के विशाल संश्लेषित डेटासेट CodeAlchemy को ओपन-सोर्स किया |
| 2024-07-15 | Qwen2-72B | 64.6% | Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए |
| 2024-07-15 | Qwen2-72B | 64.6% | Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की |
| 2024-06-20 | Claude 3.5 Sonnet | 92.0% | एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया |
| 2024-06-20 | Claude 3.5 Sonnet | 92.0% | Anthropic |
| 2024-05-13 | GPT-4o | 90.2% | OpenAI |
| 2024-03-28 | Grok-1.5 | 74.1% | xAI ने बेहतर तर्कशक्ति और 128K संदर्भ के साथ Grok-1.5 जारी किया |
| 2023-03-14 | GPT-4 | 67.0% | OpenAI |