Les chercheurs de LMSYS ont publié un classement utilisant un système de cote Elo pour comparer les grands modèles de langage, révélant que le Claude 3 Opus d'Anthropic a décroché la première place. Le modèle a obtenu une cote Elo de 1253 sur la base de combats en face à face évalués par des votants humains.

  • Claude 3 Opus détient la cote la plus élevée avec 33 250 votes totaux et un bilan de +5/-5.
  • Les modèles preview GPT-4 d'OpenAI suivent de près avec des cotes de 1251 et 1248.
  • Le Bard (Gemini Pro) de Google se classe quatrième avec une cote Elo de 1203.
  • L'ancien modèle GPT-4–0314 est classé sixième avec une cote de 1185.

Ce benchmark fournit une méthode objective pour suivre les avancées rapides de l'IA linguistique et identifier les architectures leaders à mesure que la concurrence s'intensifie parmi les grandes entreprises technologiques.