Benchmark · coding

LiveCodeBench

20 résultats 18 modèles

LiveCodeBench évalue la capacité des grands modèles de langage à résoudre des problèmes de competitive programming, à partir de défis de code collectés en continu lors de concours récents afin d'éviter la contamination par les données d'entraînement. La métrique principale est le pass@1 : la proportion de problèmes résolus correctement dès la première tentative du modèle.

En savoir plus
Exemple
Un élément typique est un problème de code de style concours — par exemple, étant donné un tableau d'entiers, écrire une fonction qui renvoie la longueur de la plus longue sous-suite strictement croissante — que le modèle doit résoudre en générant du code fonctionnel.
Notation
Chaque solution générée est exécutée sur les cas de test du problème ; le pass@1 est la fraction de problèmes pour lesquels la première soumission du modèle passe tous les tests.
Vérification
Une solution est acceptée automatiquement lorsque le code généré passe tous les cas de test cachés et publics du problème ; il n'y a ni jugement humain ni correspondance exacte de texte.
Pourquoi c'est important
Comme ses problèmes proviennent de concours publiés après la date limite d'entraînement d'un modèle, LiveCodeBench mesure une véritable capacité de raisonnement et de programmation plutôt que des réponses mémorisées, ce qui en fait un indicateur fiable et résistant à la contamination des compétences en code.
Exemple résolu
Tâche
Style de programmation compétitive (stdin/stdout). Étant donné n entiers, comptez les paires (i, j) avec i < j telles que nums[i] + nums[j] soit pair. Entrée : la première ligne est n, la seconde contient n entiers séparés par des espaces ; affichez le compte.
Solution
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
Explication
Une somme est paire exactement quand les deux termes ont la même parité, donc la réponse est C(evens, 2) + C(odds, 2) ; compter les parités se fait en O(n). LiveCodeBench exécute le programme du modèle sur des tests unitaires cachés et le note en pass@1 — correct seulement si tous les tests passent.
0 23 46 69 92 2024-07-15 2025-07-10 2026-07-06 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
Chronologie
Date Modèle Score Source
2026-07-06 Agents-A1 44.3pts Étendre l'horizon, pas les paramètres : atteindre des performances de modèles à mille milliards de paramètres avec un agent de 35M
2026-02-25 Grok 4 81.9% xAI lance le modèle de raisonnement Grok 4 avec des benchmarks agents et de codage puissants
2026-02-10 Step 3.5 Flash 86.4% Étape 3.5 Flash : un modèle MoE à 11B actifs atteint des performances agentic de pointe
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement open-source de 1T paramètres
2025-09-30 GLM-4.6 82.8% Zhipu AI lance GLM-4.6 avec des capacités agentic et une fenêtre de contexte de 128k
2025-07-28 Kimi K2 53.7% Kimi K2 : modèle MoE ouvert avec 1T de paramètres et optimiseur MuonClip
2025-07-28 Kimi K2 53.7% Moonshot lance Kimi K2, un modèle MoE agénique ouvert avec 32 milliards de paramètres activés
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3 introduit un mode de réflexion unifié et la prise en charge de 119 langues
2025-04-15 Gemini 2.0 Flash 34.5% Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 70.4% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324 améliore le raisonnement, la programmation et l'écriture en chinois par rapport à DeepSeek-V3
2025-03-11 Grok 3 79.4% xAI lance Grok 3 avec raisonnement profond et contexte de million de tokens
2025-02-19 Grok 3 (Think) 79.4% xAI publie Grok 3 Beta et l'agent DeepSearch
2025-02-19 Grok 3 mini 80.4% xAI publie Grok 3 Beta et l'agent DeepSearch
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek publie des modèles de raisonnement R1 par apprentissage par renforcement
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5 met à l'échelle l'apprentissage par renforcement avec des LLMs pour égaler o1 et battre les modèles short-CoT
2024-11-28 QwQ-32B-Preview 50.0% Qwen lance QwQ-32B-Preview, un modèle de raisonnement expérimental
2024-07-15 Qwen2-72B-Instruct 35.7% L'équipe Qwen publie la série Qwen2 avec des modèles denses et MoE de 72B
2024-07-15 Qwen2-72B-Instruct 35.7% Le rapport technique Qwen2 présente des modèles denses et MoE jusqu'à 72 milliards de paramètres