Benchmark · agentic

SWE-rebench

12 résultats 12 modèles

SWE-rebench est une variante continuellement actualisée du benchmark de programmation SWE-bench, qui tire ses tâches d'issues GitHub récentes afin de réduire le risque qu'un modèle les ait déjà vues pendant l'entraînement. Il indique le pourcentage de tâches d'ingénierie logicielle que le modèle résout (% resolved).

En savoir plus
Exemple
Un item typique fournit au modèle un vrai rapport de bug ou une demande de fonctionnalité issue d'un dépôt GitHub, et il doit modifier le code du projet pour résoudre ce problème.
Notation
La métrique est le % resolved : le nombre de tâches que le modèle corrige divisé par le nombre total de tâches, exprimé en pourcentage.
Vérification
Une solution est acceptée automatiquement lorsque la suite de tests du dépôt passe sur le code corrigé — le correctif doit faire passer au vert les tests qui échouaient sans casser les autres.
Pourquoi c'est important
Comme ses tâches sont renouvelées à partir d'issues récentes, il offre une mesure plus fiable de la véritable compétence en programmation, plus difficile à gonfler en mémorisant d'anciennes données de benchmark publiques.
Exemple résolu
Tâche
Instance SWE-rebench construite à partir d'un vrai dépôt Python de GitHub (python-slugify), figé sur un commit de base. Problème : slugify('Hello, World!') renvoie 'hello--world' — des séparateurs consécutifs produisent un double trait d'union au lieu d'un seul, alors que le slug attendu est 'hello-world'. Livrable : un patch git-diff appliqué à l'instantané du dépôt qui fait passer le test FAIL_TO_PASS tout en gardant au vert tous les tests PASS_TO_PASS.
Solution
--- a/slugify/slugify.py
+++ b/slugify/slugify.py
@@ def slugify(text):
     text = re.sub(r"[^\w\s-]", "", text).strip().lower()
-    return re.sub(r"[\s]+", "-", text)
+    text = re.sub(r"[\s]+", "-", text)
+    return re.sub(r"-{2,}", "-", text)
Explication
Le générateur de slug réduit les espaces à - mais ne déduplique jamais les traits d'union répétés, si bien que plusieurs séparateurs passent au travers ; ajouter re.sub(r'-{2,}', '-', text) les normalise en un seul -. SWE-rebench évalue par exécution : il applique le patch dans le conteneur du dépôt et ne marque l'instance résolue que si le test FAIL_TO_PASS passe désormais et que tous les tests PASS_TO_PASS passent toujours (classement = % résolues).
0 15 30 45 60 2026-02-01 2026-04-19 2026-07-05 MiniMax M2.5 · 39.6 · 2026-02-01 Claude Opus 4.6 · 51.7 · 2026-02-01 Claude Opus 4.8 xhigh · 56.5 · 2026-07-05 GLM-5.2 · 51.1 · 2026-07-05 Gemini 3.5 Flash · 49.5 · 2026-07-05 MiniMax M3 · 45.6 · 2026-07-05 DeepSeek-V4 Pro · 42.7 · 2026-07-05 MiMo V2.5 Pro · 42.4 · 2026-07-05 DeepSeek-V4 Flash · 38.4 · 2026-07-05 Qwen3.6-27B · 36.5 · 2026-07-05 Qwen3.6-35B-A3B · 33.8 · 2026-07-05 Gemma 4 31B · 16.5 · 2026-07-05
MiniMax M2.5 Claude Opus 4.6 Claude Opus 4.8 xhigh GLM-5.2 Gemini 3.5 Flash MiniMax M3 DeepSeek-V4 Pro MiMo V2.5 Pro DeepSeek-V4 Flash Qwen3.6-27B Qwen3.6-35B-A3B Gemma 4 31B
Chronologie
Date Modèle Score Source
2026-07-05 Claude Opus 4.8 xhigh 56.5% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 GLM-5.2 51.1% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 Gemini 3.5 Flash 49.5% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 MiniMax M3 45.6% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 DeepSeek-V4 Pro 42.7% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 MiMo V2.5 Pro 42.4% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 DeepSeek-V4 Flash 38.4% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 Qwen3.6-27B 36.5% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 Qwen3.6-35B-A3B 33.8% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-07-05 Gemma 4 31B 16.5% Le classement SWE-rebench ajoute GLM-5.2, Qwen3.6, Gemma 4 et améliore l'interface
2026-02-01 MiniMax M2.5 39.6% Les benchmarks désinfectés révèlent un écart de 12 points entre les meilleurs modèles de codage IA
2026-02-01 Claude Opus 4.6 51.7% Les benchmarks désinfectés révèlent un écart de 12 points entre les meilleurs modèles de codage IA