Benchmark · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena mesure la qualité des chatbots d'IA en conversation ouverte en faisant comparer par de vraies personnes deux modèles anonymes côte à côte. Les résultats sont agrégés en un classement Elo, le même indice de niveau relatif que celui utilisé aux échecs (environ 1000-1500+).
En savoir plus
- Exemple
- Un visiteur saisit une requête libre — par exemple « Explique l'intrication quantique à un enfant de 10 ans » ou « Écris une fonction Python pour inverser une liste chaînée » — voit deux modèles cachés répondre, puis choisit la meilleure réponse.
- Notation
- Chaque vote à l'aveugle est une victoire/défaite/égalité par paires ; ces votes sont regroupés parmi de nombreux utilisateurs et convertis en un score Elo, où un nombre plus élevé signifie que le modèle gagne davantage de ses confrontations.
- Vérification
- Il n'y a ni tests automatiques ni réponses de référence : le résultat est décidé uniquement par des votes de préférence humaine issus de la foule, faits à l'aveugle pour que les marques ne biaisent pas le choix.
- Pourquoi c'est important
- Parce qu'il reflète le jugement subjectif de vrais utilisateurs sur des requêtes du quotidien plutôt qu'un jeu de tests figé, c'est un classement très suivi et difficile à manipuler pour la qualité globale des chatbots.
Exemple résolu
Tâche
Prompt de Chatbot Arena (ouvert, deux modèles comparés côte à côte) : « Explique la différence entre TCP et UDP à un enfant curieux de 10 ans à l'aide d'une analogie simple, puis cite une application du quotidien qui repose sur chacun. » Deux modèles anonymes répondent au même prompt et tu votes pour la meilleure réponse.
Solution
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Explication
La réponse est jugée bonne parce qu'elle est techniquement exacte (TCP = fiable et ordonné, UDP = rapide, au mieux), utilise une analogie adaptée à l'âge et couvre les deux parties demandées (une application pour chacun). Évaluation : il n'y a pas de réponse de référence — deux modèles anonymes répondent au même prompt, une personne choisit la meilleure réponse, et les votes par paires sont agrégés dans un classement Elo/Bradley-Terry.