| 2026-09-29 |
Qwen3.8-Flash-Next (IQ3_XXS) |
91.41% |
ISTA publie les GGUF GSQ-RCO pour Qwen3.8-Flash-Next et une version Coder élaguée à 50 % d'experts
|
| 2026-09-25 |
VeriLoop E2 |
93.94% |
VeriLoop E2 : modèle post-entraîné de 27B avec échelle GGUF allant de BF16 à IQ1_M
|
| 2026-09-11 |
GPT-6 Astra |
96.3% |
OpenAI lance GPT-6 Astra, domine les classements avec un coût réduit
|
| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.9% |
DeepSeek lance le modèle V4.1-Flash avec support multimodal natif
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
87.3% |
IFM publie K2 Horizon : six modèles Apache 2.0 de 0,9B à 375B
|
| 2026-08-28 |
GLM-5.3 |
91.72% |
Z.ai affine GLM-5.3 pour des gains en cybersécurité
|
| 2026-08-25 |
QAH model (GPT-OSS 120B compressed to 60B, MXFP4) |
67.4% |
Le QAH de Multiverse Computing permet au GPT-OSS en 4 bits de surpasser sa version pleine précision
|
| 2026-08-21 |
Grok 4.6 |
94.9% |
SpaceXAI présente Grok 4.6 avec des données Cursor pour les tâches agentic
|
| 2026-08-03 |
Qwen3.8-Max |
92.6% |
Alibaba publie Qwen3.8-Max, un modèle MoE de 2,4 T de paramètres
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B
|
| 2026-07-17 |
Kimi K3 |
93.5% |
Moonshot AI publie Kimi K3 ouvert, un modèle MoE de 2,8 T de paramètres avec un contexte de 1 M
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI publie des modèles vocaux full-duplex et un tribunal allemand tient Google responsable des Résumés IA
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI annonce le retrait de o3 de ChatGPT et partage les scores des benchmarks
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI lance le modèle de raisonnement Grok 4 avec des benchmarks agents et de codage puissants
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot lance Kimi K2.5 avec la technologie Agent Swarm
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI lance les modèles GPT-5.2 Pro et Thinking pour la science et les mathématiques
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI présente GPT-5.2 avec des capacités de codage, de contexte long et de raisonnement améliorées
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI présente GPT-5.2 avec des capacités de codage, de contexte long et de raisonnement améliorées
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI lance les modèles GPT-5.2 Pro et Thinking pour la science et les mathématiques
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI lance le Hub des Data Centers Frontier et analyse le benchmark OSWorld
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-10-24 |
O1 |
77.0% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-10-24 |
GPT-4 |
39.0% |
Benchmark GPQA-Diamond : Scores, Classement et Comparaison des Modèles IA
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic lance Claude Sonnet 4.5 avec des capacités de codage et d'agent améliorées
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek publie DeepSeek-V3.1-Terminus avec des correctifs linguistiques et agent
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI présente GPT-5 avec routage unifié et raisonnement de niveau expert
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI lance GPT-5 unifié avec routage en temps réel et accès gratuit
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAI lance GPT-5 avec raisonnement adaptatif et architecture unifiée
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2 : modèle MoE ouvert avec 1T de paramètres et optimiseur MuonClip
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot lance Kimi K2, un modèle MoE agénique ouvert avec 32 milliards de paramètres activés
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek met à jour le modèle R1 avec des capacités de raisonnement et des scores aux benchmarks améliorés
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
Anthropic présente Claude Opus 4 et Sonnet 4 avec réflexion étendue et utilisation d'outils
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic présente Claude Opus 4 et Sonnet 4 avec réflexion étendue et utilisation d'outils
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic publie Claude Opus 4 et Sonnet 4 avec des mesures de sécurité ASL-3
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
Google lance Gemini 2.0 Flash avec une qualité améliorée et deux fois la vitesse de Gemini 1.5 Pro
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI lance GPT-4.1, GPT-4.1 mini et GPT-4.1 nano dans l'API
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking utilise l'apprentissage par renforcement pour améliorer le raisonnement
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
Google élargit l'accès à Gemini 2.5 Pro grâce à de solides résultats aux benchmarks
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
Google publie un modèle de raisonnement expérimental Gemini 2.5 Pro avec un contexte de 1M de tokens
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind lance le modèle expérimental Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 améliore le raisonnement, la programmation et l'écriture en chinois par rapport à DeepSeek-V3
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI lance Grok 3 avec raisonnement profond et contexte de million de tokens
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI publie GPT-4.5, son plus grand modèle, pour ChatGPT Plus
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Comparaison de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 et Grok 3 Beta
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic publie Claude 3.7 Sonnet avec contrôle dynamique du raisonnement
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI publie Grok 3 Beta et l'agent DeepSearch
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI lance le modèle o3 avec des performances élevées en raisonnement et en codage
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen lance QwQ-32B-Preview, un modèle de raisonnement expérimental
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
L'équipe Qwen publie la série Qwen2 avec des modèles denses et MoE de 72B
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Le rapport technique Qwen2 présente des modèles denses et MoE jusqu'à 72 milliards de paramètres
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic publie un complément à Claude 3.5 Sonnet avec des benchmarks de codage et de vision améliorés
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA : Un benchmark de Q&A de niveau universitaire, résistant à Google
|