Peneliti dari LMSYS telah merilis papan peringkat menggunakan sistem rating Elo untuk membandingkan model bahasa besar, mengungkapkan bahwa Claude 3 Opus dari Anthropic telah mengamankan posisi teratas. Model tersebut meraih rating Elo 1253 berdasarkan pertarungan satu lawan satu yang dievaluasi oleh pemilih manusia.
- Claude 3 Opus memegang rating tertinggi dengan total 33.250 suara dan rekor +5/-5.
- Model preview GPT-4 dari OpenAI mengikuti di dekatnya dengan rating 1251 dan 1248.
- Bard (Gemini Pro) dari Google menempati peringkat keempat dengan rating Elo 1203.
- Model lama GPT-4–0314 diperingkatkan keenam dengan rating 1185.
Benchmark ini menyediakan metode objektif untuk melacak kemajuan pesat dalam AI bahasa dan mengidentifikasi arsitektur terdepan saat persaingan di antara perusahaan teknologi utama semakin ketat.