벤치마크 · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena는 실제 사람들이 익명의 두 모델을 나란히 비교하게 하여 AI 챗봇의 자유로운 대화 능력을 측정합니다. 결과는 체스에서 쓰는 상대적 실력 수치와 같은 Elo 등급(대략 1000-1500+)으로 집계됩니다.
자세히 보기
- 예시
- 방문자가 자유로운 프롬프트(예: '양자 얽힘을 10살 아이에게 설명해줘' 또는 '연결 리스트를 뒤집는 Python 함수를 작성해줘')를 입력하면, 숨겨진 두 모델의 답변을 보고 더 나은 답을 고릅니다.
- 채점 방식
- 각 블라인드 투표는 1대1의 승/패/무승부이며, 여러 사용자의 투표를 모아 Elo 점수로 환산합니다. 점수가 높을수록 그 모델이 대결에서 더 많이 이겼다는 뜻입니다.
- 검증 방식
- 자동화된 테스트나 정답이 없으며, 결과는 오직 크라우드소싱된 사람들의 선호 투표로만 결정됩니다. 브랜드명이 선택에 영향을 주지 않도록 투표는 블라인드로 진행됩니다.
- 왜 중요한가
- 고정된 테스트 세트가 아니라 일상적인 프롬프트에 대한 실제 사용자의 주관적 판단을 반영하기 때문에, 챗봇의 전반적 품질을 보여주는 널리 주목받고 조작하기 어려운 리더보드입니다.
예제 풀이
문제
Chatbot Arena 프롬프트(개방형, 두 모델을 나란히 비교): 「호기심 많은 10살 아이에게 간단한 비유를 사용해 TCP와 UDP의 차이를 설명하고, 각각에 의존하는 일상 앱을 하나씩 말해 주세요.」 익명의 두 모델이 같은 프롬프트에 답하고, 당신이 더 나은 답변에 투표합니다.
해답
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
풀이
이 답변이 좋게 평가되는 이유는 기술적으로 정확하고(TCP = 신뢰성 있고 순서 보장, UDP = 빠르고 best-effort), 나이에 맞는 비유를 하나 사용하며, 요구된 두 부분(각각 앱 하나)을 모두 충족하기 때문입니다. 채점: 정답 레이블이 없으며 — 익명의 두 모델이 같은 프롬프트에 답하고, 사람이 더 나은 답을 고르며, 쌍대 투표가 Elo/Bradley-Terry 리더보드로 집계됩니다.