Benchmark · coding

Codeforces (Elo)

10 résultats 10 modèles

Codeforces (Elo) mesure la capacité d'un modèle en programmation compétitive en lui faisant résoudre des problèmes de concours chronométrés, exprimée sous forme d'un classement Elo de Codeforces (environ 0–4000, où à peu près 2000+ est un bon niveau).

En savoir plus
Exemple
Un élément typique est un problème algorithmique chronométré — par exemple, lire l'entrée d'un problème et afficher la bonne réponse dans des limites strictes de temps et de mémoire, en utilisant des techniques comme le parcours de graphes, la programmation dynamique ou les algorithmes gloutons.
Notation
Le résultat est un unique nombre Elo calculé à partir du nombre de problèmes de concours résolus par le modèle et de leur difficulté, placé sur la même échelle de classement que Codeforces utilise pour les compétiteurs humains.
Vérification
Chaque solution soumise est évaluée automatiquement : le code est compilé et exécuté sur un ensemble caché de cas de test, et n'est comptée comme résolue que si elle produit la bonne sortie dans les limites de temps et de mémoire.
Pourquoi c'est important
Il reflète un raisonnement algorithmique en plusieurs étapes et la capacité à écrire un code correct et efficace sous contraintes, et projette les compétences de programmation d'un modèle sur une échelle de classement que les gens comprennent déjà.
Exemple résolu
Tâche
Watermelon : étant donné un entier w (1 ≤ w ≤ 100), le poids d'une pastèque, déterminez s'il est possible de la diviser en deux parts telles que chacune pèse un nombre pair positif de kilogrammes. Affichez «YES» ou «NO».
Solution
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
Explication
La somme de deux entiers pairs positifs est paire et vaut au moins 4, donc un partage valide existe exactement lorsque w est pair et w > 2 (par exemple w=8 → 2+6). Codeforces évalue en compilant la soumission et en l'exécutant sur des cas de test cachés, en exigeant une sortie exacte sur stdout dans les limites de temps et de mémoire.
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
Chronologie
Date Modèle Score Source
2026-07-16 GFlowRL 2048.0Elo Microsoft lance GFlowRL, un RL de style GFlowNet stable pour les grands modèles de langage
2026-02-12 Gemini 3 Deep Think 3455.0Elo Google lance Gemini 3 Deep Think amélioré avec de nouveaux scores de benchmark
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3 introduit un mode de réflexion unifié et la prise en charge de 119 langues
2025-04-17 o4-mini 2719.0Elo OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo présente un benchmark de génération de code au niveau compétitif avec des cotes Elo comparables à celles des humains
2025-01-02 o1-mini 1578.0Elo CodeElo présente un benchmark de génération de code au niveau compétitif avec des cotes Elo comparables à celles des humains
2024-12-20 o3 2727.0Elo OpenAI lance le modèle o3 avec des performances élevées en raisonnement et en codage
2024-10-01 OpenAI o1-preview 89.0Elo Comparaison d'OpenAI o1 avec d'autres modèles de premier plan
2024-09-12 o1 1807.0Elo OpenAI publie o1-preview, un modèle de raisonnement qui dépasse les experts humains sur les benchmarks en mathématiques et sciences