Benchmark · coding

LiveCodeBench

20 परिणाम 18 मॉडल

LiveCodeBench यह आँकता है कि बड़े भाषा मॉडल competitive programming की समस्याओं को कितनी अच्छी तरह हल करते हैं; इसके लिए कोडिंग चुनौतियाँ हाल की प्रतियोगिताओं से लगातार इकट्ठी की जाती हैं ताकि प्रशिक्षण-डेटा संदूषण से बचा जा सके। मुख्य मीट्रिक pass@1 है — वे समस्याएँ जिन्हें मॉडल अपने पहले ही प्रयास में सही हल कर देता है, उनका अनुपात।

और पढ़ें
उदाहरण
एक सामान्य आइटम प्रतियोगिता-शैली की कोडिंग समस्या होती है — उदाहरण के लिए, पूर्णांकों की एक सूची दी गई हो और सबसे लंबी कड़ाई से बढ़ती उपअनुक्रम (strictly increasing subsequence) की लंबाई लौटाने वाला एक फ़ंक्शन लिखना — जिसे मॉडल को कार्यशील कोड बनाकर हल करना होता है।
स्कोरिंग
हर उत्पन्न समाधान को समस्या के टेस्ट केस पर चलाया जाता है; pass@1 उन समस्याओं का अनुपात है जिनमें मॉडल का पहला सबमिशन सभी टेस्ट पास कर लेता है।
सत्यापन
जब उत्पन्न कोड उस समस्या के सभी छिपे और सार्वजनिक टेस्ट केस पास कर लेता है, तो समाधान स्वतः स्वीकार हो जाता है; इसमें कोई मानवीय मूल्यांकन या सटीक-पाठ मिलान शामिल नहीं होता।
यह क्यों मायने रखता है
चूँकि इसकी समस्याएँ किसी मॉडल की प्रशिक्षण कट-ऑफ के बाद जारी हुई प्रतियोगिताओं से ली जाती हैं, इसलिए LiveCodeBench रटे-रटाए उत्तरों के बजाय वास्तविक तर्क और कोडिंग क्षमता मापता है, जिससे यह कोडिंग कौशल का एक भरोसेमंद और संदूषण-प्रतिरोधी पैमाना बन जाता है।
हल किया गया उदाहरण
कार्य
प्रतियोगी प्रोग्रामिंग शैली (stdin/stdout)। n पूर्णांक दिए गए हैं; ऐसे युग्मों (i, j) की गिनती करें जहाँ i < j और nums[i] + nums[j] सम हो। इनपुट: पहली पंक्ति में n, दूसरी पंक्ति में स्पेस से अलग किए गए n पूर्णांक; गिनती प्रिंट करें।
समाधान
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
व्याख्या
योगफल तभी सम होता है जब दोनों संख्याओं की सम-विषमता समान हो, इसलिए उत्तर C(evens, 2) + C(odds, 2) है; सम-विषमता गिनना O(n) में होता है। LiveCodeBench मॉडल के प्रोग्राम को छिपे हुए यूनिट टेस्ट पर चलाकर pass@1 से अंक देता है — सही तभी जब सभी टेस्ट पास हों।
0 23 46 69 92 2024-07-15 2025-07-10 2026-07-06 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-06 Agents-A1 44.3pts पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना
2026-02-25 Grok 4 81.9% xAI ने मजबूत एजेंटिक और कोडिंग बेंचमार्क्स के साथ Grok 4 तर्क मॉडल जारी किया
2026-02-10 Step 3.5 Flash 86.4% चरण 3.5 फ्लैश: खुला 11B-सक्रिय MoE मॉडल अग्रणी स्तर की एजेंटिक प्रदर्शन प्राप्त करता है
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-09-30 GLM-4.6 82.8% Zhipu AI ने एजेंटिक क्षमताओं और 128k संदर्भ विंडो के साथ GLM-4.6 जारी किया
2025-07-28 Kimi K2 53.7% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-28 Kimi K2 53.7% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 में एकीकृत चिंतन मोड और 119 भाषाओं का समर्थन पेश
2025-04-15 Gemini 2.0 Flash 34.5% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-03-26 Gemini 2.5 Pro 70.4% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
2025-03-11 Grok 3 79.4% xAI ने गहरा तर्क और मिलियन-टोकन संदर्भ के साथ Grok 3 जारी किया
2025-02-19 Grok 3 (Think) 79.4% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-02-19 Grok 3 mini 80.4% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है
2024-11-28 QwQ-32B-Preview 50.0% Qwen ने QwQ-32B-Preview जारी किया, एक प्रायोगिक तर्कशील मॉडल
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए