Benchmark · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena mide qué tan buenos son los chatbots de IA en la conversación abierta, haciendo que personas reales comparen dos modelos anónimos lado a lado. Los resultados se agregan en una puntuación Elo, el mismo número de habilidad relativa que se usa en el ajedrez (aproximadamente 1000-1500+).
Leer más
- Ejemplo
- Un visitante escribe una consulta libre —por ejemplo, «Explica el entrelazamiento cuántico a un niño de 10 años» o «Escribe una función en Python para invertir una lista enlazada»— ve responder a dos modelos ocultos y elige la mejor respuesta.
- Puntuación
- Cada voto a ciegas es una victoria/derrota/empate por parejas; esos votos se agrupan entre muchos usuarios y se convierten en una puntuación Elo, donde un número más alto significa que el modelo gana más de sus enfrentamientos.
- Verificación
- No hay pruebas automáticas ni respuestas de referencia: el resultado se decide únicamente por votos de preferencia humana de origen colectivo, emitidos a ciegas para que las marcas no sesguen la elección.
- Por qué importa
- Como refleja el juicio subjetivo de usuarios reales sobre indicaciones cotidianas en lugar de un conjunto fijo de pruebas, es una tabla de clasificación muy seguida y difícil de manipular sobre la calidad general de los chatbots.
Ejemplo resuelto
Tarea
Prompt de Chatbot Arena (abierto, dos modelos comparados lado a lado): «Explica la diferencia entre TCP y UDP a un niño curioso de 10 años usando una analogía sencilla y luego nombra una app cotidiana que dependa de cada uno». Dos modelos anónimos responden al mismo prompt y tú votas por la mejor respuesta.
Solución
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Explicación
La respuesta se considera buena porque es técnicamente correcta (TCP = fiable y ordenado, UDP = rápido, sin garantías), usa una analogía apropiada para su edad y cubre ambas partes pedidas (una app para cada uno). Evaluación: no hay respuesta de referencia — dos modelos anónimos responden al mismo prompt, una persona elige la mejor respuesta y los votos por pares se agregan en un ranking Elo/Bradley-Terry.