Benchmark · coding

HumanEval

saturated 8 परिणाम 6 मॉडल

HumanEval मापता है कि कोई मॉडल प्राकृतिक भाषा में दिए गए विवरण से सही Python कोड लिखने में कितना सक्षम है; इसका स्कोर pass@1 से मिलता है, यानी पहली ही कोशिश में हल किए गए प्रश्नों का अनुपात।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न में फ़ंक्शन का signature और उसकी docstring दी होती है — जैसे «n से छोटी सभी अभाज्य संख्याओं की सूची लौटाएँ» — और मॉडल को फ़ंक्शन का body पूरा करना होता है।
स्कोरिंग
मीट्रिक pass@1 है: हर उत्पन्न हल को छिपे हुए unit टेस्ट पर चलाया जाता है, और स्कोर उन 164 प्रश्नों का प्रतिशत है जिनका हल अपने सभी टेस्ट पास कर लेता है।
सत्यापन
पूरी तरह स्वचालित: कोई हल तभी सही गिना जाता है जब वह उस प्रश्न के सभी छिपे हुए unit टेस्ट पास कर ले; न कोई मानवीय आकलन, न स्ट्रिंग का सटीक मिलान।
यह क्यों मायने रखता है
यह व्यापक रूप से इस्तेमाल होने वाले पहले कोड-जनरेशन बेंचमार्क में से एक था और प्रोग्रामिंग क्षमता का मानक संदर्भ बन गया, हालाँकि अब शीर्ष मॉडल इस पर इतना ऊँचा स्कोर करते हैं कि यह लगभग संतृप्त हो चुका है और उनमें मुश्किल से ही अंतर कर पाता है।
हल किया गया उदाहरण
कार्य
इस Python फ़ंक्शन का बॉडी पूरा करें ताकि यह छिपे हुए unit tests पास कर सके: ```python from typing import List def below_zero(operations: List[int]) -> bool: """You're given a list of deposit and withdrawal operations on a bank account starting at zero balance. Detect whether the balance ever drops below zero and return True at that point; otherwise return False. >>> below_zero([1, 2, 3]) False >>> below_zero([1, 2, -4, 5]) True """ ```
समाधान
from typing import List


def below_zero(operations: List[int]) -> bool:
    balance = 0
    for op in operations:
        balance += op
        if balance < 0:
            return True
    return False
व्याख्या
एक चालू balance रखें, हर operation को क्रम में जोड़ें, और जैसे ही यह शून्य से नीचे जाए True लौटाएँ; अगर loop पूरा हो जाए तो balance कभी ऋणात्मक नहीं हुआ, इसलिए False लौटाएँ। HumanEval मूल्यांकन इस तरह करता है: model के completion को prompt के साथ जोड़कर छिपे हुए unit tests पर चलाता है (pass@k) — item तभी हल माना जाता है जब सभी assert पास हों।
0 24.5 49 73.5 98 2023-03-14 2024-11-13 2026-07-16 Grok-1.5 · 74.1 · 2024-03-28 Claude 3.5 Sonnet · 92 · 2024-06-20 Claude 3.5 Sonnet · 92 · 2024-06-20 Qwen2-72B · 64.6 · 2024-07-15 Qwen2-72B · 64.6 · 2024-07-15 Granite 4.0 3B · 83.5 · 2026-07-16 GPT-4 · 67 · 2023-03-14 GPT-4o · 90.2 · 2024-05-13
Grok-1.5 Claude 3.5 Sonnet Qwen2-72B Granite 4.0 3B GPT-4 GPT-4o
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-16 Granite 4.0 3B 83.5% IBM ने उच्च-गुणवत्ता वाले कोड के विशाल संश्लेषित डेटासेट CodeAlchemy को ओपन-सोर्स किया
2024-07-15 Qwen2-72B 64.6% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए
2024-07-15 Qwen2-72B 64.6% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-06-20 Claude 3.5 Sonnet 92.0% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2024-06-20 Claude 3.5 Sonnet 92.0% Anthropic
2024-05-13 GPT-4o 90.2% OpenAI
2024-03-28 Grok-1.5 74.1% xAI ने बेहतर तर्कशक्ति और 128K संदर्भ के साथ Grok-1.5 जारी किया
2023-03-14 GPT-4 67.0% OpenAI