Бенчмарк · general

LMSYS Arena (Elo)

23 результатов 21 моделей

LMSYS Chatbot Arena измеряет, насколько хорошо ИИ-чат-боты ведут свободный диалог: реальные люди сравнивают два анонимных ответа моделей бок о бок. Результаты сводятся в рейтинг Elo — тот же показатель относительной силы, что и в шахматах (примерно 1000-1500+).

Подробнее
Пример
Посетитель вводит произвольный запрос — например, «Объясни квантовую запутанность десятилетнему ребёнку» или «Напиши на Python функцию для разворота связного списка» — видит ответы двух скрытых моделей и выбирает лучший.
Метрика
Каждый слепой голос — это победа/поражение/ничья в паре; голоса многих пользователей объединяются и переводятся в оценку Elo, где большее число означает, что модель чаще побеждает в очных сравнениях.
Приёмка
Здесь нет автоматических тестов или эталонных ответов — результат определяется исключительно краудсорсинговыми голосами людей, поданными вслепую, чтобы бренд не влиял на выбор.
Почему важно
Поскольку рейтинг отражает субъективное мнение реальных пользователей на повседневных запросах, а не фиксированный набор тестов, это популярный и трудно поддающийся накрутке лидерборд общего качества чат-ботов.
Разбор примера
Задача
Промпт Chatbot Arena (открытый, две модели сравниваются рядом): «Объясни разницу между TCP и UDP любопытному десятилетнему ребёнку с помощью простой аналогии, а затем назови по одному повседневному приложению, которое опирается на каждый из них». Две анонимные модели отвечают на один и тот же промпт, а ты голосуешь за лучший ответ.
Решение
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Разбор
Ответ считается хорошим, потому что он технически точен (TCP = надёжный и упорядоченный, UDP = быстрый, «как получится»), использует одну понятную ребёнку аналогию и покрывает обе запрошенные части (по приложению на каждый). Оценивание: эталонного ответа нет — две анонимные модели отвечают на один промпт, человек выбирает лучший ответ, а попарные голоса агрегируются в рейтинг Elo/Bradley-Terry.
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
Хронология
Дата Модель Результат Источник
2026-07-24 Kimi K3 1679.0Elo Запуск Kimi K3 как крупнейшей модели с открытыми весами; выход Muse Spark 1.1
2026-07-24 Claude Fable 5 1760.0Elo Запуск Kimi K3 как крупнейшей модели с открытыми весами; выход Muse Spark 1.1
2026-07-24 GPT-5.6 Sol 1743.0Elo Запуск Kimi K3 как крупнейшей модели с открытыми весами; выход Muse Spark 1.1
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2025-11-18 Gemini 3 Pro 1501.0Elo Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Pro 1501.0Elo Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI выпустила Grok 4.1, возглавившую рейтинг LMArena с уменьшенными галлюцинациями
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google выпустила превью Gemini 2.5 06-05 с улучшениями в области программирования и рассуждений
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google представляет обновлённую превью-версию Gemini 2.5 Pro с улучшенным программированием и рассуждением
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind обновляет Gemini 2.5 с функцией Deep Think, выводом аудио и управлением компьютером
2025-02-19 Grok 3 1402.0Elo xAI выпускает Grok 3 Beta и агента DeepSearch
2025-02-18 Grok-3 1402.0Elo Grok-3 от xAI стал первой моделью, преодолевшей отметку 1400 в Chatbot Arena
2024-12-09 Gemini-Exp-1206 1379.0Elo Gemini-Exp-1206 от Google обошел ChatGPT в рейтинге LMArena
2024-11-15 Gemini-Exp-1114 1344.0Elo Gemini-Exp-1114 от Google заняла совместное 1-е место на Chatbot Arena
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo Экспериментальная модель Gemini 1.5 Pro 0801 от Google обошла GPT-4o в LMSYS Chatbot Arena
2024-05-15 GPT-4o 1309.0Elo OpenAI тайно тестировала GPT-4o в Chatbot Arena, заняв верхнюю строчку лидерборда
2024-03-27 Bard (Gemini Pro) 1203.0Elo Бенчмарк LMSYS ставит Claude 3 Opus на первое место с рейтингом Elo 1253
2024-03-27 GPT-4 preview models 1251.0Elo Бенчмарк LMSYS ставит Claude 3 Opus на первое место с рейтингом Elo 1253
2024-03-27 GPT-4–0314 1185.0Elo Бенчмарк LMSYS ставит Claude 3 Opus на первое место с рейтингом Elo 1253
2024-03-27 Claude 3 Sonnet 1198.0Elo Бенчмарк LMSYS ставит Claude 3 Opus на первое место с рейтингом Elo 1253
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo Бенчмарк LMSYS ставит Claude 3 Opus на первое место с рейтингом Elo 1253
2024-03-27 Mistral-Large-2402 1157.0Elo Бенчмарк LMSYS ставит Claude 3 Opus на первое место с рейтингом Elo 1253
2024-03-27 Claude 3 Opus 1253.0Elo Бенчмарк LMSYS ставит Claude 3 Opus на первое место с рейтингом Elo 1253