Benchmark · coding

LiveCodeBench

25 परिणाम 23 मॉडल

LiveCodeBench यह आँकता है कि बड़े भाषा मॉडल competitive programming की समस्याओं को कितनी अच्छी तरह हल करते हैं; इसके लिए कोडिंग चुनौतियाँ हाल की प्रतियोगिताओं से लगातार इकट्ठी की जाती हैं ताकि प्रशिक्षण-डेटा संदूषण से बचा जा सके। मुख्य मीट्रिक pass@1 है — वे समस्याएँ जिन्हें मॉडल अपने पहले ही प्रयास में सही हल कर देता है, उनका अनुपात।

और पढ़ें
उदाहरण
एक सामान्य आइटम प्रतियोगिता-शैली की कोडिंग समस्या होती है — उदाहरण के लिए, पूर्णांकों की एक सूची दी गई हो और सबसे लंबी कड़ाई से बढ़ती उपअनुक्रम (strictly increasing subsequence) की लंबाई लौटाने वाला एक फ़ंक्शन लिखना — जिसे मॉडल को कार्यशील कोड बनाकर हल करना होता है।
स्कोरिंग
हर उत्पन्न समाधान को समस्या के टेस्ट केस पर चलाया जाता है; pass@1 उन समस्याओं का अनुपात है जिनमें मॉडल का पहला सबमिशन सभी टेस्ट पास कर लेता है।
सत्यापन
जब उत्पन्न कोड उस समस्या के सभी छिपे और सार्वजनिक टेस्ट केस पास कर लेता है, तो समाधान स्वतः स्वीकार हो जाता है; इसमें कोई मानवीय मूल्यांकन या सटीक-पाठ मिलान शामिल नहीं होता।
यह क्यों मायने रखता है
चूँकि इसकी समस्याएँ किसी मॉडल की प्रशिक्षण कट-ऑफ के बाद जारी हुई प्रतियोगिताओं से ली जाती हैं, इसलिए LiveCodeBench रटे-रटाए उत्तरों के बजाय वास्तविक तर्क और कोडिंग क्षमता मापता है, जिससे यह कोडिंग कौशल का एक भरोसेमंद और संदूषण-प्रतिरोधी पैमाना बन जाता है।
हल किया गया उदाहरण
कार्य
प्रतियोगी प्रोग्रामिंग शैली (stdin/stdout)। n पूर्णांक दिए गए हैं; ऐसे युग्मों (i, j) की गिनती करें जहाँ i < j और nums[i] + nums[j] सम हो। इनपुट: पहली पंक्ति में n, दूसरी पंक्ति में स्पेस से अलग किए गए n पूर्णांक; गिनती प्रिंट करें।
समाधान
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
व्याख्या
योगफल तभी सम होता है जब दोनों संख्याओं की सम-विषमता समान हो, इसलिए उत्तर C(evens, 2) + C(odds, 2) है; सम-विषमता गिनना O(n) में होता है। LiveCodeBench मॉडल के प्रोग्राम को छिपे हुए यूनिट टेस्ट पर चलाकर pass@1 से अंक देता है — सही तभी जब सभी टेस्ट पास हों।
0 23 46 69 92 2024-07-15 2025-08-22 2026-09-29 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) · 66.5 · 2026-08-25 30B base models with PLVR · 27.8 · 2026-08-31 Qwen3.8-Flash-Next (IQ3_S) · 86.9 · 2026-09-29 Qwen3.8-Flash-Next (IQ3_XXS) · 86.3 · 2026-09-29 Qwen3.8-Flash-Next Coder · 86.3 · 2026-09-29
Qwen2-72B-Instruct QwQ-32B-Preview Kimi k1.5 (short-CoT) DeepSeek-R1-Distill-Qwen-32B Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) 30B base models with PLVR Qwen3.8-Flash-Next (IQ3_S) Qwen3.8-Flash-Next (IQ3_XXS) Qwen3.8-Flash-Next Coder
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-29 Qwen3.8-Flash-Next (IQ3_S) 86.86% ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए
2026-09-29 Qwen3.8-Flash-Next (IQ3_XXS) 86.29% ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए
2026-09-29 Qwen3.8-Flash-Next Coder 86.28% ISTA ने Qwen3.8-Flash-Next और 50% विशेषज्ञ-कटाई वाले कोडर बिल्ड के लिए GSQ-RCO GGUF जारी किए
2026-08-31 30B base models with PLVR 27.8% PLVR सत्यापन योग्य तर्क कार्यक्रमों को सीखने के लिए प्रतीकात्मक बैकप्रोपगेशन का उपयोग करता है
2026-08-25 QAH model (GPT-OSS 120B compressed to 60B, MXFP4) 66.5% मल्टीवर्स कंप्यूटिंग का QAH 4-बिट GPT-OSS को इसके पूर्ण-प्रीसिजन मूल से बेहतर प्रदर्शन करने में सक्षम बनाता है
2026-07-06 Agents-A1 44.3pts पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना
2026-02-25 Grok 4 81.9% xAI ने मजबूत एजेंटिक और कोडिंग बेंचमार्क्स के साथ Grok 4 तर्क मॉडल जारी किया
2026-02-10 Step 3.5 Flash 86.4% चरण 3.5 फ्लैश: खुला 11B-सक्रिय MoE मॉडल अग्रणी स्तर की एजेंटिक प्रदर्शन प्राप्त करता है
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI ने Kimi K2 Thinking जारी किया, एक ओपन-सोर्स 1T पैरामीटर तर्क मॉडल
2025-09-30 GLM-4.6 82.8% Zhipu AI ने एजेंटिक क्षमताओं और 128k संदर्भ विंडो के साथ GLM-4.6 जारी किया
2025-07-28 Kimi K2 53.7% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-28 Kimi K2 53.7% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 में एकीकृत चिंतन मोड और 119 भाषाओं का समर्थन पेश
2025-04-15 Gemini 2.0 Flash 34.5% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-03-26 Gemini 2.5 Pro 70.4% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
2025-03-11 Grok 3 79.4% xAI ने गहरा तर्क और मिलियन-टोकन संदर्भ के साथ Grok 3 जारी किया
2025-02-19 Grok 3 (Think) 79.4% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-02-19 Grok 3 mini 80.4% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2024-11-28 QwQ-32B-Preview 50.0% Qwen ने QwQ-32B-Preview जारी किया, एक प्रायोगिक तर्कशील मॉडल
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए