| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
Google Research publie RRSI pour prévenir le surajustement du harnais des agents IA
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
ISTA publie les GGUF GSQ-RCO pour Qwen3.8-Flash-Next et une version Coder élaguée à 50 % d'experts
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
ROFT améliore les modèles agents en affinant sur des explications auto-générées
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AI publie Ember-1, un modèle post-entraîné basé sur Kimi K3 utilisant 40 % de tokens en moins
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via la réparation guidée par tests
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via la réparation guidée par tests
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via la réparation guidée par tests
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via la réparation guidée par tests
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via la réparation guidée par tests
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via une réparation guidée par des tests
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via une réparation guidée par des tests
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via une réparation guidée par des tests
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via une réparation guidée par des tests
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic utilise un RL spécifique au rôle pour améliorer les agents de codage via une réparation guidée par des tests
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM publie K2 Horizon : six modèles Apache 2.0 de 0,9B à 375B
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM publie K2 Horizon : six modèles Apache 2.0 de 0,9B à 375B
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY permet à Qwen3-14B de dominer AppWorld grâce au RL uniquement basé sur le résultat
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM publie Granite 4.2 avec raisonnement natif et RL agentique pour les modèles d'entreprise ouverts
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM publie Granite 4.2 avec raisonnement natif et RL agentique pour les modèles d'entreprise ouverts
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
Meta publie Muse Video avec audio natif ; Stripe acquiert OpenRouter
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai propose une loi d'échelle post-entraînement et publie GLM 5.3 ; Ornith-1.5 lance avec auto-amélioration
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5 lance des modèles de 9B, 35B-A3B et 397B avec un entraînement auto-améliorant
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
L'agent Kozuchi résout 374 instances SWE-bench Verified en utilisant Qwen3.5-27B
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Meta publie Muse Glimmer, un modèle agentique open-weights de 30B fonctionnant sur un GPU grand public
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
Microsoft Research publie le framework Orchard pour l'IA agentique évolutive
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic publie Claude Opus 5 avec la réflexion par défaut et des gains en codage agentique
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
Kimi K3, DeepSeek V4 Pro et GLM-5.2 comparés sur les benchmarks, la licence et le coût de déploiement
|
| 2026-07-17 |
Devstral 2 |
72.2% |
Mistral Vibe for Code mène quatre agents de codage sur la tâche d'échafaudage à PR
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
Mistral Vibe for Code mène quatre agents de codage sur la tâche d'échafaudage à PR
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE réaligne les pools d'experts MoE pour un affinage de domaine spécifique amélioré
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE réaligne les pools d'experts MoE pour un affinage de domaine spécifique amélioré
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier introduit un cadre de vérification polyvalent avec notation continue
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
Alibaba lance Qwen3.6-27B, surpassant son prédécesseur plus grand sur les benchmarks de codage
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek publie V4 avec une architecture longue-contexte efficace pour les agents
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI annonce le retrait de o3 de ChatGPT et partage les scores des benchmarks
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic lance Claude Sonnet 4.6 avec un codage amélioré, l'utilisation d'ordinateur et un contexte de 1M de tokens
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
Les benchmarks désinfectés révèlent un écart de 12 points entre les meilleurs modèles de codage IA
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
Les benchmarks désinfectés révèlent un écart de 12 points entre les meilleurs modèles de codage IA
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B et DeepSeek V4 Flash en tête des benchmarks de codage local
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI lance GPT-5.2, surpassant Gemini 3 dans les benchmarks de codage et de raisonnement
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI présente GPT-5.2 avec des capacités de pointe pour le travail intellectuel professionnel
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral lance les modèles de codage Devstral 2 et Mistral Vibe CLI
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral lance les modèles de codage Devstral 2 et Mistral Vibe CLI
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI fait de GPT-5.1-Codex-Max le modèle par défaut dans Codex CLI
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI publie Kimi K2 Thinking avec utilisation d'outils agents
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement open-source de 1T paramètres
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic lance Claude Sonnet 4.5 avec des capacités de codage et d'agent améliorées
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI lance GPT-5 unifié avec routage en temps réel et accès gratuit
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI lance l'API GPT-5 avec des améliorations pour le codage et les agents
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot lance Kimi K2, un modèle MoE agénique ouvert avec 32 milliards de paramètres activés
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2 : modèle MoE ouvert avec 1T de paramètres et optimiseur MuonClip
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI publie Kimi-K2-Instruct, un modèle MoE de 1T paramètres avec des capacités agentic
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI lance Kimi K2, un modèle MoE de 1T paramètres avec des capacités agéntiques
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI lance Devstral Small 1.1 et Devstral Medium avec All Hands AI
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI lance Devstral Small 1.1 et Devstral Medium avec All Hands AI
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI publie Devstral, un LLM agentique pour l'ingénierie logicielle
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI lance o4-mini, un modèle de raisonnement multimodal plus rapide et moins cher
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI lance la famille GPT-4.1 avec un contexte de 1M de tokens et des améliorations en codage
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI lance GPT-4.1, GPT-4.1 mini et GPT-4.1 nano dans l'API
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google présente le modèle expérimental Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google présente le modèle de raisonnement Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI publie GPT-4.5, son plus grand modèle, pour ChatGPT Plus
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet atteint 49 % sur SWE-bench Verified
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI lance le modèle o3 avec des performances élevées en raisonnement et en codage
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI présente en avant-première le modèle de raisonnement o3 avec des percées sur ARC AGI et Frontier Math
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet atteint 49 % sur SWE-bench Verified avec un échafaudage d'agent minimal
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic met à jour Claude 3.5 Sonnet, lance Claude 3.5 Haiku et la version bêta de l'utilisation de l'ordinateur
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic met à jour Claude 3.5 Sonnet, lance Claude 3.5 Haiku et la version bêta de l'utilisation de l'ordinateur
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI publie SWE-bench Verified avec un sous-ensemble validé par des humains
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI publie SWE-bench Verified avec un sous-ensemble validé par des humains
|