Benchmark · general

LMSYS Arena (Elo)

23 resultados 21 modelos

LMSYS Chatbot Arena mide qué tan buenos son los chatbots de IA en la conversación abierta, haciendo que personas reales comparen dos modelos anónimos lado a lado. Los resultados se agregan en una puntuación Elo, el mismo número de habilidad relativa que se usa en el ajedrez (aproximadamente 1000-1500+).

Leer más
Ejemplo
Un visitante escribe una consulta libre —por ejemplo, «Explica el entrelazamiento cuántico a un niño de 10 años» o «Escribe una función en Python para invertir una lista enlazada»— ve responder a dos modelos ocultos y elige la mejor respuesta.
Puntuación
Cada voto a ciegas es una victoria/derrota/empate por parejas; esos votos se agrupan entre muchos usuarios y se convierten en una puntuación Elo, donde un número más alto significa que el modelo gana más de sus enfrentamientos.
Verificación
No hay pruebas automáticas ni respuestas de referencia: el resultado se decide únicamente por votos de preferencia humana de origen colectivo, emitidos a ciegas para que las marcas no sesguen la elección.
Por qué importa
Como refleja el juicio subjetivo de usuarios reales sobre indicaciones cotidianas en lugar de un conjunto fijo de pruebas, es una tabla de clasificación muy seguida y difícil de manipular sobre la calidad general de los chatbots.
Ejemplo resuelto
Tarea
Prompt de Chatbot Arena (abierto, dos modelos comparados lado a lado): «Explica la diferencia entre TCP y UDP a un niño curioso de 10 años usando una analogía sencilla y luego nombra una app cotidiana que dependa de cada uno». Dos modelos anónimos responden al mismo prompt y tú votas por la mejor respuesta.
Solución
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Explicación
La respuesta se considera buena porque es técnicamente correcta (TCP = fiable y ordenado, UDP = rápido, sin garantías), usa una analogía apropiada para su edad y cubre ambas partes pedidas (una app para cada uno). Evaluación: no hay respuesta de referencia — dos modelos anónimos responden al mismo prompt, una persona elige la mejor respuesta y los votos por pares se agregan en un ranking Elo/Bradley-Terry.
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
Cronología
Fecha Modelo Puntuación Fuente
2026-07-24 Kimi K3 1679.0Elo Lanzamiento de Kimi K3 como el modelo de pesos abiertos más grande; lanzamiento de Muse Spark 1.1
2026-07-24 Claude Fable 5 1760.0Elo Lanzamiento de Kimi K3 como el modelo de pesos abiertos más grande; lanzamiento de Muse Spark 1.1
2026-07-24 GPT-5.6 Sol 1743.0Elo Lanzamiento de Kimi K3 como el modelo de pesos abiertos más grande; lanzamiento de Muse Spark 1.1
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2025-11-18 Gemini 3 Pro 1501.0Elo Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Pro 1501.0Elo Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI lanza Grok 4.1, encabezando el ranking de LMArena con menos alucinaciones
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google lanza la vista previa de Gemini 2.5 06-05 con mejoras en codificación y razonamiento
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google presenta una versión preliminar mejorada de Gemini 2.5 Pro con codificación y razonamiento mejorados
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind actualiza Gemini 2.5 con Deep Think, salida de audio y uso del ordenador
2025-02-19 Grok 3 1402.0Elo xAI lanza Grok 3 Beta y el agente DeepSearch
2025-02-18 Grok-3 1402.0Elo Grok-3 de xAI se convierte en el primer modelo en superar los 1400 puntos en Chatbot Arena
2024-12-09 Gemini-Exp-1206 1379.0Elo Gemini-Exp-1206 de Google supera a ChatGPT en el ranking de LMArena
2024-11-15 Gemini-Exp-1114 1344.0Elo Gemini-Exp-1114 de Google se clasifica en el puesto 1 compartido en Chatbot Arena
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo El Gemini 1.5 Pro 0801 experimental de Google supera a GPT-4o en LMSYS Chatbot Arena
2024-05-15 GPT-4o 1309.0Elo OpenAI probó en secreto GPT-4o en Chatbot Arena, encabezando el ranking
2024-03-27 Bard (Gemini Pro) 1203.0Elo El benchmark de LMSYS clasifica a Claude 3 Opus en el primer lugar con una puntuación Elo de 1253
2024-03-27 GPT-4 preview models 1251.0Elo El benchmark de LMSYS clasifica a Claude 3 Opus en el primer lugar con una puntuación Elo de 1253
2024-03-27 GPT-4–0314 1185.0Elo El benchmark de LMSYS clasifica a Claude 3 Opus en el primer lugar con una puntuación Elo de 1253
2024-03-27 Claude 3 Sonnet 1198.0Elo El benchmark de LMSYS clasifica a Claude 3 Opus en el primer lugar con una puntuación Elo de 1253
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo El benchmark de LMSYS clasifica a Claude 3 Opus en el primer lugar con una puntuación Elo de 1253
2024-03-27 Mistral-Large-2402 1157.0Elo El benchmark de LMSYS clasifica a Claude 3 Opus en el primer lugar con una puntuación Elo de 1253
2024-03-27 Claude 3 Opus 1253.0Elo El benchmark de LMSYS clasifica a Claude 3 Opus en el primer lugar con una puntuación Elo de 1253