| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeek lance le modèle V4.1-Flash avec support multimodal natif
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFM publie K2 Horizon : six modèles Apache 2.0 de 0,9B à 375B
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFM publie K2 Horizon : six modèles Apache 2.0 de 0,9B à 375B
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta lance Muse Spark 1.3 avec moins d'appels d'outils et de tokens
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM publie Granite 4.2 avec raisonnement natif et RL agentique pour les modèles d'entreprise ouverts
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM publie Granite 4.2 avec raisonnement natif et RL agentique pour les modèles d'entreprise ouverts
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAI présente Grok 4.6 avec des données Cursor pour les tâches agentic
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeek lance le modèle multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
agents |
94.0% |
Meta publie Muse Video avec audio natif ; Stripe acquiert OpenRouter
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5 lance des modèles de 9B, 35B-A3B et 397B avec un entraînement auto-améliorant
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
La version GA de DeepSeek-V4-Pro améliore les capacités des agents et ajoute le support de l'API Responses
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAI publie Grok 4.6 ; Alibaba ouvre Qwen3.8-MoE ; DeepSeek V4 Pro GA
|
| 2026-08-11 |
Opus 5 |
86.74% |
L'agent auto-développant Ouroboros établit de nouveaux records avec Opus 5
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Meta publie Muse Glimmer, un modèle agentique open-weights de 30B fonctionnant sur un GPU grand public
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731 atteint 82,7 % sur Terminal-Bench 2.1 dans un environnement public
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AI publie Pokee-Isaac 28B, un modèle de contexte de 10M de tokens pour un déploiement en périmètre fermé
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek publie V4-Flash-0731, surpassant V4-Pro à moindre coût
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
Meta publie l'agent terminal beta Muse Code alimenté par Muse Spark 1.2
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
Alibaba annonce Qwen3.8-Max avec 2,4T de paramètres et des poids ouverts à venir
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
Alibaba publie Qwen3.8-Max, un modèle MoE de 2,4 T de paramètres
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek publie V4-Flash avec d'importants gains post-entraînement et des poids ouverts
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeek publie V4-Flash avec des gains post-entraînement et des poids ouverts
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek publie V4-Flash-0731 avec d'importantes améliorations agentic à moindre coût
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek lance la version bêta publique de DeepSeek-V4-Flash avec des capacités d'agent améliorées
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
KwaiKAT publie KAT-Coder-V2.5, un modèle de codage agentique entraîné sur plus de 100 000 environnements vérifiables
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google publie Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber pour les charges de travail agentic
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber
|
| 2026-07-08 |
hermes |
55.0% |
Les utilisateurs comparent Mimo v2.5 à DeepSeek V4 Flash et Hermes
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAI lance Grok 4.5 à faible coût avec des performances de benchmark mitigées
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifier introduit un cadre de vérification polyvalent avec notation continue
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8 avec KV FP8 atteint 79,8 % sur Terminal-Bench 2.1
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
Alibaba lance Qwen3.6-27B, surpassant son prédécesseur plus grand sur les benchmarks de codage
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAI lance GPT-5.5, un modèle entièrement réentraîné avec traitement omnimodal natif
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI lance GPT-5.5 avec des capacités agentic et un doublement du prix de l'API
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI lance GPT-5.5 et GPT-5.5 Pro via l'API
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMax open-source M2.7, un modèle MoE auto-évolutif atteignant 56,22 % sur SWE-Pro
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
Étape 3.5 Flash : un modèle MoE à 11B actifs atteint des performances agentic de pointe
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI fait de GPT-5.1-Codex-Max le modèle par défaut dans Codex CLI
|