Benchmark · general

LMSYS Arena (Elo)

23 resultados 21 modelos

O LMSYS Chatbot Arena mede o quão bons são os chatbots de IA em conversas abertas, fazendo pessoas reais compararem dois modelos anônimos lado a lado. Os resultados são agregados em uma pontuação Elo, o mesmo número de habilidade relativa usado no xadrez (cerca de 1000-1500+).

Saiba mais
Exemplo
Um visitante digita um comando livre — por exemplo, «Explique emaranhamento quântico para uma criança de 10 anos» ou «Escreva uma função em Python para inverter uma lista encadeada» — vê dois modelos ocultos responderem e escolhe a melhor resposta.
Pontuação
Cada voto às cegas é uma vitória/derrota/empate em pares; esses votos são reunidos entre muitos usuários e convertidos em uma pontuação Elo, onde um número maior significa que o modelo vence mais dos seus confrontos.
Verificação
Não há testes automáticos nem respostas de referência — o resultado é decidido puramente por votos de preferência humana obtidos de forma colaborativa, feitos às cegas para que as marcas não influenciem a escolha.
Por que importa
Por refletir o julgamento subjetivo de usuários reais em comandos do dia a dia, em vez de um conjunto fixo de testes, é um ranking muito acompanhado e difícil de manipular sobre a qualidade geral dos chatbots.
Exemplo resolvido
Tarefa
Prompt do Chatbot Arena (aberto, dois modelos comparados lado a lado): «Explique a diferença entre TCP e UDP para uma criança curiosa de 10 anos usando uma analogia simples e depois cite um app do dia a dia que depende de cada um». Dois modelos anônimos respondem ao mesmo prompt e você vota na melhor resposta.
Solução
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Explicação
A resposta é considerada boa porque é tecnicamente correta (TCP = confiável e ordenado, UDP = rápido, sem garantias), usa uma analogia adequada à idade e cobre as duas partes pedidas (um app para cada). Avaliação: não há resposta de referência — dois modelos anônimos respondem ao mesmo prompt, uma pessoa escolhe a melhor resposta e os votos em pares são agregados em um ranking Elo/Bradley-Terry.
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-24 Kimi K3 1679.0Elo Kimi K3 é lançado como o maior modelo de pesos abertos; Muse Spark 1.1 é liberado
2026-07-24 Claude Fable 5 1760.0Elo Kimi K3 é lançado como o maior modelo de pesos abertos; Muse Spark 1.1 é liberado
2026-07-24 GPT-5.6 Sol 1743.0Elo Kimi K3 é lançado como o maior modelo de pesos abertos; Muse Spark 1.1 é liberado
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2025-11-18 Gemini 3 Pro 1501.0Elo Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Pro 1501.0Elo Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI lança Grok 4.1, liderando o ranking do LMArena com menos alucinações
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google lança pré-visualização do Gemini 2.5 06-05 com melhorias em codificação e raciocínio
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google apresenta versão preliminar aprimorada do Gemini 2.5 Pro com codificação e raciocínio melhorados
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind atualiza o Gemini 2.5 com Deep Think, saída de áudio e uso do computador
2025-02-19 Grok 3 1402.0Elo xAI lança Grok 3 Beta e agente DeepSearch
2025-02-18 Grok-3 1402.0Elo Grok-3 da xAI torna-se o primeiro modelo a ultrapassar 1400 no Chatbot Arena
2024-12-09 Gemini-Exp-1206 1379.0Elo Gemini-Exp-1206 do Google supera o ChatGPT no ranking do LMArena
2024-11-15 Gemini-Exp-1114 1344.0Elo Gemini-Exp-1114 da Google ocupa o 1º lugar compartilhado no Chatbot Arena
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo Gemini 1.5 Pro 0801 experimental do Google supera GPT-4o no LMSYS Chatbot Arena
2024-05-15 GPT-4o 1309.0Elo OpenAI testou secretamente o GPT-4o na Chatbot Arena, liderando o ranking
2024-03-27 Bard (Gemini Pro) 1203.0Elo Benchmark do LMSYS classifica Claude 3 Opus em primeiro lugar com classificação Elo de 1253
2024-03-27 GPT-4 preview models 1251.0Elo Benchmark do LMSYS classifica Claude 3 Opus em primeiro lugar com classificação Elo de 1253
2024-03-27 GPT-4–0314 1185.0Elo Benchmark do LMSYS classifica Claude 3 Opus em primeiro lugar com classificação Elo de 1253
2024-03-27 Claude 3 Sonnet 1198.0Elo Benchmark do LMSYS classifica Claude 3 Opus em primeiro lugar com classificação Elo de 1253
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo Benchmark do LMSYS classifica Claude 3 Opus em primeiro lugar com classificação Elo de 1253
2024-03-27 Mistral-Large-2402 1157.0Elo Benchmark do LMSYS classifica Claude 3 Opus em primeiro lugar com classificação Elo de 1253
2024-03-27 Claude 3 Opus 1253.0Elo Benchmark do LMSYS classifica Claude 3 Opus em primeiro lugar com classificação Elo de 1253