Investigadores de LMSYS han publicado un ranking que utiliza un sistema de puntuación Elo para comparar modelos de lenguaje grandes, revelando que Claude 3 Opus de Anthropic ha asegurado el primer puesto. El modelo logró una puntuación Elo de 1253 basada en combates uno a uno evaluados por votantes humanos.
- Claude 3 Opus mantiene la puntuación más alta con 33.250 votos totales y un récord de +5/-5.
- Los modelos preview de GPT-4 de OpenAI siguen de cerca con puntuaciones de 1251 y 1248.
- Bard (Gemini Pro) de Google ocupa el cuarto lugar con una puntuación Elo de 1203.
- El modelo más antiguo GPT-4–0314 está clasificado en sexto lugar con una puntuación de 1185.
Este benchmark proporciona un método objetivo para rastrear los rápidos avances en la IA de lenguaje e identificar las arquitecturas líderes a medida que se intensifica la competencia entre las principales empresas tecnológicas.