Benchmark · general
LMSYS Arena (Elo)
O LMSYS Chatbot Arena mede o quão bons são os chatbots de IA em conversas abertas, fazendo pessoas reais compararem dois modelos anônimos lado a lado. Os resultados são agregados em uma pontuação Elo, o mesmo número de habilidade relativa usado no xadrez (cerca de 1000-1500+).
Saiba mais
- Exemplo
- Um visitante digita um comando livre — por exemplo, «Explique emaranhamento quântico para uma criança de 10 anos» ou «Escreva uma função em Python para inverter uma lista encadeada» — vê dois modelos ocultos responderem e escolhe a melhor resposta.
- Pontuação
- Cada voto às cegas é uma vitória/derrota/empate em pares; esses votos são reunidos entre muitos usuários e convertidos em uma pontuação Elo, onde um número maior significa que o modelo vence mais dos seus confrontos.
- Verificação
- Não há testes automáticos nem respostas de referência — o resultado é decidido puramente por votos de preferência humana obtidos de forma colaborativa, feitos às cegas para que as marcas não influenciem a escolha.
- Por que importa
- Por refletir o julgamento subjetivo de usuários reais em comandos do dia a dia, em vez de um conjunto fixo de testes, é um ranking muito acompanhado e difícil de manipular sobre a qualidade geral dos chatbots.
Exemplo resolvido
Tarefa
Prompt do Chatbot Arena (aberto, dois modelos comparados lado a lado): «Explique a diferença entre TCP e UDP para uma criança curiosa de 10 anos usando uma analogia simples e depois cite um app do dia a dia que depende de cada um». Dois modelos anônimos respondem ao mesmo prompt e você vota na melhor resposta.
Solução
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Explicação
A resposta é considerada boa porque é tecnicamente correta (TCP = confiável e ordenado, UDP = rápido, sem garantias), usa uma analogia adequada à idade e cobre as duas partes pedidas (um app para cada). Avaliação: não há resposta de referência — dois modelos anônimos respondem ao mesmo prompt, uma pessoa escolhe a melhor resposta e os votos em pares são agregados em um ranking Elo/Bradley-Terry.