Бенчмарк · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena измеряет, насколько хорошо ИИ-чат-боты ведут свободный диалог: реальные люди сравнивают два анонимных ответа моделей бок о бок. Результаты сводятся в рейтинг Elo — тот же показатель относительной силы, что и в шахматах (примерно 1000-1500+).
Подробнее
- Пример
- Посетитель вводит произвольный запрос — например, «Объясни квантовую запутанность десятилетнему ребёнку» или «Напиши на Python функцию для разворота связного списка» — видит ответы двух скрытых моделей и выбирает лучший.
- Метрика
- Каждый слепой голос — это победа/поражение/ничья в паре; голоса многих пользователей объединяются и переводятся в оценку Elo, где большее число означает, что модель чаще побеждает в очных сравнениях.
- Приёмка
- Здесь нет автоматических тестов или эталонных ответов — результат определяется исключительно краудсорсинговыми голосами людей, поданными вслепую, чтобы бренд не влиял на выбор.
- Почему важно
- Поскольку рейтинг отражает субъективное мнение реальных пользователей на повседневных запросах, а не фиксированный набор тестов, это популярный и трудно поддающийся накрутке лидерборд общего качества чат-ботов.
Разбор примера
Задача
Промпт Chatbot Arena (открытый, две модели сравниваются рядом): «Объясни разницу между TCP и UDP любопытному десятилетнему ребёнку с помощью простой аналогии, а затем назови по одному повседневному приложению, которое опирается на каждый из них». Две анонимные модели отвечают на один и тот же промпт, а ты голосуешь за лучший ответ.
Решение
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Разбор
Ответ считается хорошим, потому что он технически точен (TCP = надёжный и упорядоченный, UDP = быстрый, «как получится»), использует одну понятную ребёнку аналогию и покрывает обе запрошенные части (по приложению на каждый). Оценивание: эталонного ответа нет — две анонимные модели отвечают на один промпт, человек выбирает лучший ответ, а попарные голоса агрегируются в рейтинг Elo/Bradley-Terry.