벤치마크 · general

LMSYS Arena (Elo)

23 결과 21 모델

LMSYS Chatbot Arena는 실제 사람들이 익명의 두 모델을 나란히 비교하게 하여 AI 챗봇의 자유로운 대화 능력을 측정합니다. 결과는 체스에서 쓰는 상대적 실력 수치와 같은 Elo 등급(대략 1000-1500+)으로 집계됩니다.

자세히 보기
예시
방문자가 자유로운 프롬프트(예: '양자 얽힘을 10살 아이에게 설명해줘' 또는 '연결 리스트를 뒤집는 Python 함수를 작성해줘')를 입력하면, 숨겨진 두 모델의 답변을 보고 더 나은 답을 고릅니다.
채점 방식
각 블라인드 투표는 1대1의 승/패/무승부이며, 여러 사용자의 투표를 모아 Elo 점수로 환산합니다. 점수가 높을수록 그 모델이 대결에서 더 많이 이겼다는 뜻입니다.
검증 방식
자동화된 테스트나 정답이 없으며, 결과는 오직 크라우드소싱된 사람들의 선호 투표로만 결정됩니다. 브랜드명이 선택에 영향을 주지 않도록 투표는 블라인드로 진행됩니다.
왜 중요한가
고정된 테스트 세트가 아니라 일상적인 프롬프트에 대한 실제 사용자의 주관적 판단을 반영하기 때문에, 챗봇의 전반적 품질을 보여주는 널리 주목받고 조작하기 어려운 리더보드입니다.
예제 풀이
문제
Chatbot Arena 프롬프트(개방형, 두 모델을 나란히 비교): 「호기심 많은 10살 아이에게 간단한 비유를 사용해 TCP와 UDP의 차이를 설명하고, 각각에 의존하는 일상 앱을 하나씩 말해 주세요.」 익명의 두 모델이 같은 프롬프트에 답하고, 당신이 더 나은 답변에 투표합니다.
해답
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
풀이
이 답변이 좋게 평가되는 이유는 기술적으로 정확하고(TCP = 신뢰성 있고 순서 보장, UDP = 빠르고 best-effort), 나이에 맞는 비유를 하나 사용하며, 요구된 두 부분(각각 앱 하나)을 모두 충족하기 때문입니다. 채점: 정답 레이블이 없으며 — 익명의 두 모델이 같은 프롬프트에 답하고, 사람이 더 나은 답을 고르며, 쌍대 투표가 Elo/Bradley-Terry 리더보드로 집계됩니다.
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
타임라인
날짜 모델 점수 출처
2026-07-24 Kimi K3 1679.0Elo Kimi K3가 최대 오픈 가중치 모델로 출시; Muse Spark 1.1 공개
2026-07-24 Claude Fable 5 1760.0Elo Kimi K3가 최대 오픈 가중치 모델로 출시; Muse Spark 1.1 공개
2026-07-24 GPT-5.6 Sol 1743.0Elo Kimi K3가 최대 오픈 가중치 모델로 출시; Muse Spark 1.1 공개
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
2025-11-18 Gemini 3 Pro 1501.0Elo Google, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-11-18 Gemini 3 Pro 1501.0Elo 구글, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI, Grok 4.1 출시 및 환각 현상 감소로 LMArena 리더보드 정상 등극
2025-06-05 Gemini 2.5 06-05 1470.0Elo 구글, 코딩 및 추론 업그레이드가 적용된 Gemini 2.5 06-05 프리뷰 출시
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google, 개선된 코딩 및 추론 기능을 갖춘 Gemini 2.5 Pro 업그레이드 버전 미리보기 출시
2025-05-20 Gemini 2.5 Pro 1415.0Elo 구글 딥마인드, Deep Think, 오디오 출력, 컴퓨터 사용 기능으로 Gemini 2.5 업데이트
2025-02-19 Grok 3 1402.0Elo xAI가 Grok 3 베타 및 DeepSearch 에이전트 출시
2025-02-18 Grok-3 1402.0Elo xAI의 Grok-3가 Chatbot Arena에서 1400점을 돌파한 첫 번째 모델이 되다
2024-12-09 Gemini-Exp-1206 1379.0Elo 구글의 Gemini-Exp-1206이 LMArena 리더보드에서 ChatGPT를 앞지름
2024-11-15 Gemini-Exp-1114 1344.0Elo 구글의 Gemini-Exp-1114가 Chatbot Arena에서 공동 1위에 랭크
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo 구글의 실험용 Gemini 1.5 Pro 0801, LMSYS Chatbot Arena에서 GPT-4o를 제치다
2024-05-15 GPT-4o 1309.0Elo OpenAI, Chatbot Arena에서 GPT-4o를 비공개로 테스트하며 리더보드 정상 등극
2024-03-27 Bard (Gemini Pro) 1203.0Elo LMSYS 벤치마크, Elo 평가점수 1253으로 Claude 3 Opus를 최상위 랭킹
2024-03-27 GPT-4 preview models 1251.0Elo LMSYS 벤치마크, Elo 평가점수 1253으로 Claude 3 Opus를 최상위 랭킹
2024-03-27 GPT-4–0314 1185.0Elo LMSYS 벤치마크, Elo 평가점수 1253으로 Claude 3 Opus를 최상위 랭킹
2024-03-27 Claude 3 Sonnet 1198.0Elo LMSYS 벤치마크, Elo 평가점수 1253으로 Claude 3 Opus를 최상위 랭킹
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo LMSYS 벤치마크, Elo 평가점수 1253으로 Claude 3 Opus를 최상위 랭킹
2024-03-27 Mistral-Large-2402 1157.0Elo LMSYS 벤치마크, Elo 평가점수 1253으로 Claude 3 Opus를 최상위 랭킹
2024-03-27 Claude 3 Opus 1253.0Elo LMSYS 벤치마크, Elo 평가점수 1253으로 Claude 3 Opus를 최상위 랭킹