LMSYS 연구원들은 대규모 언어 모델을 비교하기 위해 Elo 평가 시스템을 사용한 리더보드를 출시했으며, Anthropic의 Claude 3 Opus가 1위를 차지했다고 밝혔습니다. 이 모델은 인간 투표자가 평가한 일대일 전투를 기반으로 Elo 평가점수 1253을 달성했습니다.
- Claude 3 Opus는 총 33,250표와 +5/-5 기록으로 최고 점수를 유지합니다.
- OpenAI의 GPT-4 미리보기 모델은 1251과 1248의 평가점수로 그 뒤를 잇습니다.
- Google의 Bard (Gemini Pro)는 Elo 평가점수 1203으로 4위에 랭크됩니다.
- 구형 GPT-4–0314 모델은 1185의 평가점수로 6위에 랭크됩니다.
이 벤치마크는 언어 AI의 빠른 발전을 추적하고 주요 기술 기업 간 경쟁이 심화됨에 따라 선도적인 아키텍처를 식별하는 객관적인 방법을 제공합니다.