Pesquisadores do LMSYS lançaram um ranking usando um sistema de classificação Elo para comparar grandes modelos de linguagem, revelando que o Claude 3 Opus da Anthropic garantiu o primeiro lugar. O modelo alcançou uma classificação Elo de 1253 com base em batalhas um a um avaliadas por eleitores humanos.
- Claude 3 Opus detém a maior classificação com 33.250 votos totais e um recorde de +5/-5.
- Os modelos preview do GPT-4 da OpenAI seguem de perto com classificações de 1251 e 1248.
- O Bard (Gemini Pro) do Google ocupa o quarto lugar com uma classificação Elo de 1203.
- O modelo mais antigo GPT-4–0314 está classificado em sexto lugar com uma classificação de 1185.
Este benchmark fornece um método objetivo para acompanhar os rápidos avanços na IA de linguagem e identificar as arquiteturas líderes à medida que a competição se intensifica entre as principais empresas de tecnologia.