Benchmark · agentic

SWE-bench Verified

63 résultats 41 modèles

Vérifie si un agent d'IA sait résoudre de vrais issues GitHub de bout en bout. L'ensemble « Verified » réunit 500 tâches validées manuellement, issues de dépôts Python open source populaires.

En savoir plus
Exemple
À partir d'un rapport de bug et du dépôt, le modèle doit produire un patch de code — par exemple corriger une fonction d'analyse de dates défaillante pour que la suite de tests du projet réussisse.
Notation
% d'issues résolus — généralement rapporté en pass@1 (une seule tentative). Plus c'est élevé, mieux c'est.
Vérification
Entièrement automatique : le patch généré est appliqué et les vrais tests unitaires cachés du projet s'exécutent dans un bac à sable. Une tâche n'est comptabilisée que si tous les tests visés réussissent et que rien ne régresse.
Pourquoi c'est important
Le principal benchmark d'agents de code en conditions réelles et un chiffre phare de chaque sortie de modèle de pointe ; les progrès ici mesurent à quel point les agents se rapprochent du génie logiciel autonome.
Exemple résolu
Tâche
Dépôt django/django à un commit de base fixe. Rapport de bug : django.utils.text.slugify("___This-is-a-Test___", allow_unicode=True) renvoie '___this-is-a-test___', alors que les tirets bas et traits d'union en tête et en fin devraient être supprimés pour obtenir 'this-is-a-test'. Le modèle ne reçoit que le texte de l'issue et le dépôt, et doit produire un patch au format unified diff.
Solution
--- a/django/utils/text.py
+++ b/django/utils/text.py
@@ def slugify(value, allow_unicode=False):
     value = re.sub(r"[^\w\s-]", "", value.lower())
-    return re.sub(r"[-\s]+", "-", value)
+    return re.sub(r"[-\s]+", "-", value).strip("-_")
Explication
slugify réduit les séparateurs internes mais ne coupe jamais les -/_ qui entourent la chaîne ; ajouter .strip("-_") au dernier re.sub les supprime ; le patch est minimal et préserve tout le reste du comportement. SWE-bench Verified applique le patch au dépôt au commit de base et note en exécutant la suite cachée — il ne réussit que si chaque test FAIL_TO_PASS passe au vert tandis que tous les tests PASS_TO_PASS le restent.
0 25 50 75 100 2024-08-13 2025-08-11 2026-08-10 Agentless · 32 · 2024-08-13 GPT‑4o · 33.2 · 2024-08-13 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-22 Claude 3.5 Sonnet · 49 · 2024-10-30 Claude 3.5 Sonnet · 49 · 2025-01-06 Claude 3.5 Haiku · 40.6 · 2024-10-22 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2024-12-20 o3 · 71.7 · 2026-03-25 GPT-4.5 · 38 · 2025-03-05 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-25 Gemini 2.5 Pro · 63.8 · 2025-03-26 GPT-4.1 · 54.6 · 2025-04-14 GPT‑4.1 · 54.6 · 2025-04-14 o4-mini · 68.1 · 2025-04-17 Devstral · 46.8 · 2025-05-21 Claude Opus 4 · 72.5 · 2025-05-22 Claude Opus 4 · 72.5 · 2025-05-23 Claude Sonnet 4 · 72.7 · 2025-05-23 Deepseek-R1-0528 · 57.6 · 2025-05-30 Devstral Medium · 61.6 · 2025-07-10 Devstral Small 1.1 · 53.6 · 2025-07-10 Kimi K2-Instruct · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-11 Kimi K2 · 65.8 · 2025-07-28 Kimi K2 · 65.8 · 2025-07-28 GLM-4.5 · 64.2 · 2025-08-06 GPT‑5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 GPT-5 · 74.9 · 2025-08-07 Claude Sonnet 4.5 · 77.2 · 2025-09-29 Claude Sonnet 4.5 · 77.2 · 2025-09-30 Kimi K2 Thinking · 71.3 · 2025-11-07 Kimi K2 Thinking · 71.3 · 2025-11-19 GPT-5.1-Codex-Max · 77.9 · 2025-11-19 Devstral 2 · 72.2 · 2025-12-09 Devstral 2 · 72.2 · 2026-07-17 Devstral Small 2 · 68 · 2025-12-09 Devstral Small 2 · 68 · 2026-07-17 GPT-5.2 Thinking · 80 · 2025-12-11 GPT-5.2 Thinking · 80 · 2025-12-11 Qwen3.6-27B · 77.2 · 2026-01-28 Qwen3.6-27B · 77.2 · 2026-04-25 Qwen3.6-27B · 77.2 · 2026-08-10 Claude Opus 4.6 · 80.8 · 2026-02-01 Claude Opus 4.6 · 80.8 · 2026-02-05 MiniMax M2.5 · 80.2 · 2026-02-01 Claude Sonnet 4.6 · 79.6 · 2026-02-17 V4-Pro-Max · 80.6 · 2026-04-24 LLM-as-a-Verifier · 78.2 · 2026-07-07 Qwen3.5-35B-A3B · 6 · 2026-07-14 Qwen3-30B-A3B · 6 · 2026-07-14 DeepSeek V4 Pro · 80.6 · 2026-07-19 Claude Opus 5 · 96 · 2026-07-24 Inkling-Small · 80.2 · 2026-08-03 Orchard-SWE · 69.7 · 2026-08-03 Claude 3.7 Sonnet · 62.3 · 2025-02-24 OpenAI o3 · 71.7 · 2025-04-16
Agentless GPT‑4o Claude 3.5 Sonnet Claude 3.5 Haiku o3 GPT-4.5 Gemini 2.5 Pro GPT-4.1 GPT‑4.1 o4-mini Devstral Claude Opus 4 Claude Sonnet 4 Deepseek-R1-0528 Devstral Medium Devstral Small 1.1 Kimi K2-Instruct Kimi K2 GLM-4.5 GPT‑5 GPT-5 Claude Sonnet 4.5 Kimi K2 Thinking GPT-5.1-Codex-Max Devstral 2 Devstral Small 2 GPT-5.2 Thinking Qwen3.6-27B Claude Opus 4.6 MiniMax M2.5 Claude Sonnet 4.6 V4-Pro-Max LLM-as-a-Verifier Qwen3.5-35B-A3B Qwen3-30B-A3B DeepSeek V4 Pro Claude Opus 5 Inkling-Small Orchard-SWE Claude 3.7 Sonnet OpenAI o3
Chronologie
Date Modèle Score Source
2026-08-10 Qwen3.6-27B 77.2% Meta publie Muse Glimmer, un modèle agentique open-weights de 30B fonctionnant sur un GPU grand public
2026-08-03 Orchard-SWE 69.7% Microsoft Research publie le framework Orchard pour l'IA agentique évolutive
2026-08-03 Inkling-Small 80.2% Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B
2026-07-24 Claude Opus 5 96.0% Anthropic publie Claude Opus 5 avec la réflexion par défaut et des gains en codage agentique
2026-07-19 DeepSeek V4 Pro 80.6% Kimi K3, DeepSeek V4 Pro et GLM-5.2 comparés sur les benchmarks, la licence et le coût de déploiement
2026-07-17 Devstral Small 2 68.0% Mistral Vibe for Code mène quatre agents de codage sur la tâche d'échafaudage à PR
2026-07-17 Devstral 2 72.2% Mistral Vibe for Code mène quatre agents de codage sur la tâche d'échafaudage à PR
2026-07-14 Qwen3.5-35B-A3B 6.0% UMoE réaligne les pools d'experts MoE pour un affinage de domaine spécifique amélioré
2026-07-14 Qwen3-30B-A3B 6.0% UMoE réaligne les pools d'experts MoE pour un affinage de domaine spécifique amélioré
2026-07-07 LLM-as-a-Verifier 78.2% LLM-as-a-Verifier introduit un cadre de vérification polyvalent avec notation continue
2026-04-25 Qwen3.6-27B 77.2% Alibaba lance Qwen3.6-27B, surpassant son prédécesseur plus grand sur les benchmarks de codage
2026-04-24 V4-Pro-Max 80.6% DeepSeek publie V4 avec une architecture longue-contexte efficace pour les agents
2026-03-25 o3 71.7% OpenAI annonce le retrait de o3 de ChatGPT et partage les scores des benchmarks
2026-02-17 Claude Sonnet 4.6 79.6% Anthropic lance Claude Sonnet 4.6 avec un codage amélioré, l'utilisation d'ordinateur et un contexte de 1M de tokens
2026-02-05 Claude Opus 4.6 80.8% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2026-02-01 Claude Opus 4.6 80.8% Les benchmarks désinfectés révèlent un écart de 12 points entre les meilleurs modèles de codage IA
2026-02-01 MiniMax M2.5 80.2% Les benchmarks désinfectés révèlent un écart de 12 points entre les meilleurs modèles de codage IA
2026-01-28 Qwen3.6-27B 77.2% Qwen 3.6-27B et DeepSeek V4 Flash en tête des benchmarks de codage local
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI présente GPT-5.2 avec des capacités de pointe pour le travail intellectuel professionnel
2025-12-11 GPT-5.2 Thinking 80.0% OpenAI lance GPT-5.2, surpassant Gemini 3 dans les benchmarks de codage et de raisonnement
2025-12-09 Devstral 2 72.2% Mistral lance les modèles de codage Devstral 2 et Mistral Vibe CLI
2025-12-09 Devstral Small 2 68.0% Mistral lance les modèles de codage Devstral 2 et Mistral Vibe CLI
2025-11-19 GPT-5.1-Codex-Max 77.9% OpenAI fait de GPT-5.1-Codex-Max le modèle par défaut dans Codex CLI
2025-11-19 Kimi K2 Thinking 71.3% Moonshot AI publie Kimi K2 Thinking avec utilisation d'outils agents
2025-11-07 Kimi K2 Thinking 71.3% Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement open-source de 1T paramètres
2025-09-30 Claude Sonnet 4.5 77.2% Anthropic lance Claude Sonnet 4.5 avec des capacités de codage et d'agent améliorées
2025-09-29 Claude Sonnet 4.5 77.2% Anthropic
2025-08-07 GPT‑5 74.9% OpenAI lance l'API GPT-5 avec des améliorations pour le codage et les agents
2025-08-07 GPT-5 74.9% OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée
2025-08-07 GPT-5 74.9% OpenAI lance GPT-5 unifié avec routage en temps réel et accès gratuit
2025-08-07 GPT-5 74.9% OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert
2025-08-07 GPT-5 74.9% OpenAI
2025-08-06 GLM-4.5 64.2% Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek
2025-07-28 Kimi K2 65.8% Kimi K2 : modèle MoE ouvert avec 1T de paramètres et optimiseur MuonClip
2025-07-28 Kimi K2 65.8% Moonshot lance Kimi K2, un modèle MoE agénique ouvert avec 32 milliards de paramètres activés
2025-07-11 Kimi K2-Instruct 65.8% Moonshot AI publie Kimi-K2-Instruct, un modèle MoE de 1T paramètres avec des capacités agentic
2025-07-11 Kimi K2 65.8% Moonshot AI lance Kimi K2, un modèle MoE de 1T paramètres avec des capacités agéntiques
2025-07-10 Devstral Medium 61.6% Mistral AI lance Devstral Small 1.1 et Devstral Medium avec All Hands AI
2025-07-10 Devstral Small 1.1 53.6% Mistral AI lance Devstral Small 1.1 et Devstral Medium avec All Hands AI
2025-05-30 Deepseek-R1-0528 57.6% DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
2025-05-23 Claude Opus 4 72.5% Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
2025-05-23 Claude Sonnet 4 72.7% Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
2025-05-22 Claude Opus 4 72.5% Anthropic
2025-05-21 Devstral 46.8% Mistral AI publie Devstral, un LLM agentique pour l'ingénierie logicielle
2025-04-17 o4-mini 68.1% OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher
2025-04-16 OpenAI o3 71.7% OpenAI
2025-04-14 GPT-4.1 54.6% OpenAI lance la famille GPT-4.1 avec un contexte de 1M de tokens et des améliorations en codage
2025-04-14 GPT‑4.1 54.6% OpenAI lance GPT-4.1, GPT-4.1 mini et GPT-4.1 nano dans l'API
2025-03-26 Gemini 2.5 Pro 63.8% Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
2025-03-25 Gemini 2.5 Pro 63.8% Google présente le modèle de raisonnement Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google présente le modèle expérimental Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 63.8% Google DeepMind
2025-03-05 GPT-4.5 38.0% OpenAI publie GPT-4.5, son plus grand modèle, pour ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 62.3% Anthropic
2025-01-06 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet atteint 49 % sur SWE-bench Verified
2024-12-20 o3 71.7% OpenAI lance le modèle o3 avec des performances élevées en raisonnement et en codage
2024-12-20 o3 71.7% OpenAI présente en avant-première le modèle de raisonnement o3 avec des percées sur ARC AGI et Frontier Math
2024-10-30 Claude 3.5 Sonnet 49.0% Claude 3.5 Sonnet atteint 49 % sur SWE-bench Verified avec un échafaudage d'agent minimal
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic met à jour Claude 3.5 Sonnet, lance Claude 3.5 Haiku et la version bêta de l'utilisation de l'ordinateur
2024-10-22 Claude 3.5 Haiku 40.6% Anthropic met à jour Claude 3.5 Sonnet, lance Claude 3.5 Haiku et la version bêta de l'utilisation de l'ordinateur
2024-10-22 Claude 3.5 Sonnet 49.0% Anthropic
2024-08-13 Agentless 32.0% OpenAI publie SWE-bench Verified avec un sous-ensemble validé par des humains
2024-08-13 GPT‑4o 33.2% OpenAI publie SWE-bench Verified avec un sous-ensemble validé par des humains