| 2026-09-10 |
DeepSeek-V4.1-Flash |
74.2% |
DeepSeek lance le modèle V4.1-Flash avec support multimodal natif
|
| 2026-09-04 |
GPT-6 Astra |
74.1% |
OpenAI publie GPT-6 Astra, un modèle d'utilisation informatique avec une fenêtre de contexte de 1,05M
|
| 2026-09-04 |
Muse Spark 1.3 |
75.4% |
Meta lance Muse Spark 1.3 avec moins d'appels d'outils et de tokens
|
| 2026-08-26 |
GLM-5.3-Flash |
63.0% |
Ox Alpha est GLM-5.3-Flash
|
| 2026-08-22 |
GLM-5.3 |
69.0% |
GLM-5.3 égale la précision de Claude Fable 5 sur DeepSWE pour un cinquième du coût
|
| 2026-08-22 |
Claude Fable 5 |
69.7% |
GLM-5.3 égale la précision de Claude Fable 5 sur DeepSWE pour un cinquième du coût
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
59.3% |
DeepSeek lance le modèle multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
Ornith-1.5 |
56.0% |
Z.ai propose une loi d'échelle post-entraînement et publie GLM 5.3 ; Ornith-1.5 lance avec auto-amélioration
|
| 2026-08-19 |
Ornith-1.5 |
56.0% |
Ornith-1.5 lance des modèles de 9B, 35B-A3B et 397B avec un entraînement auto-améliorant
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
62.8% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 sur DeepSWE : coût, codage et routage
|
| 2026-08-18 |
Claude Fable 5 |
69.7% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 sur DeepSWE : coût, codage et routage
|
| 2026-08-18 |
GPT-5.6 Sol |
85.8% |
DeepSeek V4 Pro et GPT-5.6 Sol résolvent 83 % des tâches DeepSWE en cascade pour 3,35 $
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
88.5% |
DeepSeek V4 Pro et GPT-5.6 Sol résolvent 83 % des tâches DeepSWE en cascade pour 3,35 $
|
| 2026-08-17 |
GLM-5.3 |
66.9% |
Z.ai lance le modèle de codage GLM-5.3 ; Cursor rejoint SpaceXAI
|
| 2026-08-13 |
Gemini 3.7 Flash |
65.3% |
Google présente Gemini 3.7 Flash avec une meilleure programmation et des coûts réduits
|
| 2026-08-13 |
DeepSeek-V4-Pro |
62.7% |
La version GA de DeepSeek-V4-Pro améliore les capacités des agents et ajoute le support de l'API Responses
|
| 2026-08-13 |
Grok 4.6 |
65.9% |
SpaceXAI publie Grok 4.6 avec un contexte de 500K et un raisonnement agentic amélioré
|
| 2026-08-07 |
DeepSeek-V4 Flash 0731 |
53.3% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna sur DeepSWE : Coût et codage
|
| 2026-08-07 |
GPT-5.6 Luna |
67.2% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna sur DeepSWE : Coût et codage
|
| 2026-08-03 |
Qwen3.8-Max |
56.6% |
Alibaba publie Qwen3.8-Max, un modèle MoE de 2,4 T de paramètres
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
54.4% |
DeepSeek publie V4-Flash-0731 avec d'importantes améliorations agentic à moindre coût
|
| 2026-07-31 |
DeepSeek-V4-Flash |
54.4% |
DeepSeek lance la version bêta publique de DeepSeek-V4-Flash avec des capacités d'agent améliorées
|
| 2026-07-27 |
Gemini 3.6 Flash |
49.0% |
Google lance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber
|
| 2026-07-27 |
Kimi K3 |
68.5% |
Kimi K3 bat GPT-5.6 Sol sur DeepSWE pass@4 et coûte 64 % de moins
|
| 2026-07-27 |
GPT-5.6 Sol |
72.7% |
Kimi K3 bat GPT-5.6 Sol sur DeepSWE pass@4 et coûte 64 % de moins
|