Benchmark · coding

Codeforces (Elo)

10 परिणाम 10 मॉडल

Codeforces (Elo) किसी मॉडल की competitive programming क्षमता को मापता है, जिसमें उसे समय-सीमा वाली प्रतियोगिता की समस्याएँ हल करनी होती हैं, और परिणाम को Codeforces Elo रेटिंग के रूप में दिखाया जाता है (लगभग 0–4000, जहाँ करीब 2000+ मजबूत माना जाता है)।

और पढ़ें
उदाहरण
एक सामान्य आइटम समय-सीमा वाली algorithmic समस्या होती है — उदाहरण के लिए, किसी समस्या का इनपुट पढ़ना और सख्त समय व मेमोरी सीमा के भीतर सही उत्तर छापना, जिसमें graph search, dynamic programming या greedy algorithms जैसी तकनीकों का उपयोग होता है।
स्कोरिंग
परिणाम एक ही Elo संख्या होती है, जो इस आधार पर निकाली जाती है कि मॉडल ने कितनी प्रतियोगिता समस्याएँ हल कीं और वे कितनी कठिन थीं, और इसे उसी रेटिंग पैमाने पर रखा जाता है जिसे Codeforces मानव प्रतियोगियों के लिए इस्तेमाल करता है।
सत्यापन
हर भेजा गया हल अपने-आप जाँचा जाता है: कोड को compile करके छिपे हुए test cases के एक सेट पर चलाया जाता है, और तभी हल माना जाता है जब वह समय व मेमोरी सीमा के भीतर सही आउटपुट देता है।
यह क्यों मायने रखता है
यह बहु-चरणीय algorithmic तर्क और सीमाओं के भीतर सही व कुशल code लिखने की क्षमता को दर्शाता है, और किसी मॉडल के coding कौशल को उस रेटिंग पैमाने पर लाता है जिसे लोग पहले से समझते हैं।
हल किया गया उदाहरण
कार्य
Watermelon: एक पूर्णांक w (1 ≤ w ≤ 100) दिया गया है, जो एक तरबूज़ का वज़न है; बताइए कि क्या इसे दो हिस्सों में इस तरह बाँटा जा सकता है कि हर हिस्से का वज़न धनात्मक सम संख्या (किलोग्राम में) हो। «YES» या «NO» प्रिंट करें।
समाधान
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
व्याख्या
दो धनात्मक सम पूर्णांकों का योग स्वयं सम होता है और कम से कम 4 होता है, इसलिए वैध विभाजन ठीक तभी संभव है जब w सम हो और w > 2 हो (उदाहरण के लिए w=8 → 2+6)। Codeforces सबमिशन को कंपाइल करके छिपे हुए टेस्ट केसों पर चलाकर मूल्यांकन करता है और समय व मेमोरी सीमा के भीतर stdout पर बिल्कुल सही आउटपुट माँगता है।
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-16 GFlowRL 2048.0Elo माइक्रोसॉफ्ट ने बड़े भाषा मॉडलों के लिए GFlowRL जारी किया, एक स्थिर GFlowNet-शैली RL
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google ने नए बेंचमार्क स्कोर के साथ अपग्रेडेड Gemini 3 Deep Think जारी किया
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 में एकीकृत चिंतन मोड और 119 भाषाओं का समर्थन पेश
2025-04-17 o4-mini 2719.0Elo OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo ने मानवीय तुलनीय Elo रेटिंग्स के साथ प्रतियोगिता-स्तर का कोड जनरेशन बेंचमार्क पेश किया
2025-01-02 o1-mini 1578.0Elo CodeElo ने मानवीय तुलनीय Elo रेटिंग्स के साथ प्रतियोगिता-स्तर का कोड जनरेशन बेंचमार्क पेश किया
2024-12-20 o3 2727.0Elo OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-10-01 OpenAI o1-preview 89.0Elo OpenAI o1 की तुलना अन्य शीर्ष मॉडलों से
2024-09-12 o1 1807.0Elo OpenAI ने गणित और विज्ञान मानकों पर मानवीय विशेषज्ञों को पार करने वाले एक तर्क मॉडल o1-preview को जारी किया