Investigadores de LMSYS han publicado un ranking que utiliza un sistema de puntuación Elo para comparar modelos de lenguaje grandes, revelando que Claude 3 Opus de Anthropic ha asegurado el primer puesto. El modelo logró una puntuación Elo de 1253 basada en combates uno a uno evaluados por votantes humanos.

  • Claude 3 Opus mantiene la puntuación más alta con 33.250 votos totales y un récord de +5/-5.
  • Los modelos preview de GPT-4 de OpenAI siguen de cerca con puntuaciones de 1251 y 1248.
  • Bard (Gemini Pro) de Google ocupa el cuarto lugar con una puntuación Elo de 1203.
  • El modelo más antiguo GPT-4–0314 está clasificado en sexto lugar con una puntuación de 1185.

Este benchmark proporciona un método objetivo para rastrear los rápidos avances en la IA de lenguaje e identificar las arquitecturas líderes a medida que se intensifica la competencia entre las principales empresas tecnológicas.