Benchmark · general

LMSYS Arena (Elo)

23 résultats 21 modèles

LMSYS Chatbot Arena mesure la qualité des chatbots d'IA en conversation ouverte en faisant comparer par de vraies personnes deux modèles anonymes côte à côte. Les résultats sont agrégés en un classement Elo, le même indice de niveau relatif que celui utilisé aux échecs (environ 1000-1500+).

En savoir plus
Exemple
Un visiteur saisit une requête libre — par exemple « Explique l'intrication quantique à un enfant de 10 ans » ou « Écris une fonction Python pour inverser une liste chaînée » — voit deux modèles cachés répondre, puis choisit la meilleure réponse.
Notation
Chaque vote à l'aveugle est une victoire/défaite/égalité par paires ; ces votes sont regroupés parmi de nombreux utilisateurs et convertis en un score Elo, où un nombre plus élevé signifie que le modèle gagne davantage de ses confrontations.
Vérification
Il n'y a ni tests automatiques ni réponses de référence : le résultat est décidé uniquement par des votes de préférence humaine issus de la foule, faits à l'aveugle pour que les marques ne biaisent pas le choix.
Pourquoi c'est important
Parce qu'il reflète le jugement subjectif de vrais utilisateurs sur des requêtes du quotidien plutôt qu'un jeu de tests figé, c'est un classement très suivi et difficile à manipuler pour la qualité globale des chatbots.
Exemple résolu
Tâche
Prompt de Chatbot Arena (ouvert, deux modèles comparés côte à côte) : « Explique la différence entre TCP et UDP à un enfant curieux de 10 ans à l'aide d'une analogie simple, puis cite une application du quotidien qui repose sur chacun. » Deux modèles anonymes répondent au même prompt et tu votes pour la meilleure réponse.
Solution
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Explication
La réponse est jugée bonne parce qu'elle est techniquement exacte (TCP = fiable et ordonné, UDP = rapide, au mieux), utilise une analogie adaptée à l'âge et couvre les deux parties demandées (une application pour chacun). Évaluation : il n'y a pas de réponse de référence — deux modèles anonymes répondent au même prompt, une personne choisit la meilleure réponse, et les votes par paires sont agrégés dans un classement Elo/Bradley-Terry.
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
Chronologie
Date Modèle Score Source
2026-07-24 Kimi K3 1679.0Elo Lancement de Kimi K3, le plus grand modèle à poids ouverts ; sortie de Muse Spark 1.1
2026-07-24 Claude Fable 5 1760.0Elo Lancement de Kimi K3, le plus grand modèle à poids ouverts ; sortie de Muse Spark 1.1
2026-07-24 GPT-5.6 Sol 1743.0Elo Lancement de Kimi K3, le plus grand modèle à poids ouverts ; sortie de Muse Spark 1.1
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2025-11-18 Gemini 3 Pro 1501.0Elo Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Pro 1501.0Elo Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI lance Grok 4.1, en tête du classement LMArena avec moins d'hallucinations
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google publie la version bêta Gemini 2.5 06-05 avec des améliorations en codage et raisonnement
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google présente une version préliminaire améliorée de Gemini 2.5 Pro avec codage et raisonnement optimisés
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind met à jour Gemini 2.5 avec Deep Think, la sortie audio et l'utilisation de l'ordinateur
2025-02-19 Grok 3 1402.0Elo xAI publie Grok 3 Beta et l'agent DeepSearch
2025-02-18 Grok-3 1402.0Elo Grok-3 de xAI devient le premier modèle à dépasser 1400 sur Chatbot Arena
2024-12-09 Gemini-Exp-1206 1379.0Elo Gemini-Exp-1206 de Google dépasse ChatGPT sur le classement LMArena
2024-11-15 Gemini-Exp-1114 1344.0Elo Gemini-Exp-1114 de Google se classe ex æquo à la première place sur Chatbot Arena
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo Le Gemini 1.5 Pro 0801 expérimental de Google dépasse GPT-4o sur LMSYS Chatbot Arena
2024-05-15 GPT-4o 1309.0Elo OpenAI a testé en secret GPT-4o sur Chatbot Arena, atteignant la tête du classement
2024-03-27 Bard (Gemini Pro) 1203.0Elo Le benchmark LMSYS classe Claude 3 Opus en tête avec une cote Elo de 1253
2024-03-27 GPT-4 preview models 1251.0Elo Le benchmark LMSYS classe Claude 3 Opus en tête avec une cote Elo de 1253
2024-03-27 GPT-4–0314 1185.0Elo Le benchmark LMSYS classe Claude 3 Opus en tête avec une cote Elo de 1253
2024-03-27 Claude 3 Sonnet 1198.0Elo Le benchmark LMSYS classe Claude 3 Opus en tête avec une cote Elo de 1253
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo Le benchmark LMSYS classe Claude 3 Opus en tête avec une cote Elo de 1253
2024-03-27 Mistral-Large-2402 1157.0Elo Le benchmark LMSYS classe Claude 3 Opus en tête avec une cote Elo de 1253
2024-03-27 Claude 3 Opus 1253.0Elo Le benchmark LMSYS classe Claude 3 Opus en tête avec une cote Elo de 1253