Benchmark · general

LMSYS Arena (Elo)

23 hasil 21 model

LMSYS Chatbot Arena mengukur seberapa baik chatbot AI dalam percakapan terbuka dengan meminta orang sungguhan membandingkan dua model anonim secara berdampingan. Hasilnya digabungkan menjadi peringkat Elo, angka keterampilan relatif yang sama seperti yang dipakai dalam catur (sekitar 1000-1500+).

Selengkapnya
Contoh
Seorang pengunjung mengetik perintah bebas — misalnya «Jelaskan keterjeratan kuantum kepada anak berusia 10 tahun» atau «Tulis fungsi Python untuk membalik linked list» — melihat dua model tersembunyi menjawab, lalu memilih jawaban yang lebih baik.
Penilaian
Setiap suara buta adalah menang/kalah/seri secara berpasangan; suara-suara ini dikumpulkan dari banyak pengguna dan diubah menjadi skor Elo, di mana angka yang lebih tinggi berarti model itu lebih sering menang dalam pertandingannya.
Verifikasi
Tidak ada tes otomatis atau jawaban acuan — hasilnya ditentukan murni oleh suara preferensi manusia dari banyak orang, diberikan secara buta agar nama merek tidak memengaruhi pilihan.
Mengapa penting
Karena mencerminkan penilaian subjektif pengguna nyata atas perintah sehari-hari alih-alih kumpulan tes yang tetap, ini adalah papan peringkat kualitas chatbot secara keseluruhan yang banyak diperhatikan dan sulit dicurangi.
Contoh penyelesaian
Tugas
Prompt Chatbot Arena (terbuka, dua model dibandingkan berdampingan): «Jelaskan perbedaan antara TCP dan UDP kepada anak berusia 10 tahun yang penasaran menggunakan analogi sederhana, lalu sebutkan satu aplikasi sehari-hari yang mengandalkan masing-masing.» Dua model anonim menjawab prompt yang sama dan kamu memilih jawaban yang lebih baik.
Solusi
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Penjelasan
Jawaban dinilai baik karena secara teknis akurat (TCP = andal dan berurutan, UDP = cepat, best-effort), memakai satu analogi yang sesuai usia, dan mencakup kedua bagian yang diminta (satu aplikasi untuk masing-masing). Penilaian: tidak ada jawaban acuan — dua model anonim menjawab prompt yang sama, seorang manusia memilih jawaban yang lebih baik, dan suara berpasangan digabungkan menjadi papan peringkat Elo/Bradley-Terry.
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
Linimasa
Tanggal Model Skor Sumber
2026-07-24 Kimi K3 1679.0Elo Kimi K3 diluncurkan sebagai model bobot terbuka terbesar; Muse Spark 1.1 dirilis
2026-07-24 Claude Fable 5 1760.0Elo Kimi K3 diluncurkan sebagai model bobot terbuka terbesar; Muse Spark 1.1 dirilis
2026-07-24 GPT-5.6 Sol 1743.0Elo Kimi K3 diluncurkan sebagai model bobot terbuka terbesar; Muse Spark 1.1 dirilis
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2025-11-18 Gemini 3 Pro 1501.0Elo Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Pro 1501.0Elo Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI merilis Grok 4.1, memimpin papan peringkat LMArena dengan halusinasi yang berkurang
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google merilis pratinjau Gemini 2.5 06-05 dengan peningkatan pemrograman dan penalaran
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google memperkenalkan pratinjau Gemini 2.5 Pro yang ditingkatkan dengan kemampuan coding dan penalaran yang lebih baik
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind memperbarui Gemini 2.5 dengan Deep Think, output audio, dan penggunaan komputer
2025-02-19 Grok 3 1402.0Elo xAI merilis Grok 3 Beta dan agen DeepSearch
2025-02-18 Grok-3 1402.0Elo Grok-3 dari xAI menjadi model pertama yang melampaui skor 1400 di Chatbot Arena
2024-12-09 Gemini-Exp-1206 1379.0Elo Gemini-Exp-1206 dari Google melampaui ChatGPT di papan peringkat LMArena
2024-11-15 Gemini-Exp-1114 1344.0Elo Gemini-Exp-1114 dari Google menempati peringkat bersama No. 1 di Chatbot Arena
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo Gemini 1.5 Pro 0801 eksperimental Google melampaui GPT-4o di LMSYS Chatbot Arena
2024-05-15 GPT-4o 1309.0Elo OpenAI secara diam-diam menguji GPT-4o di Chatbot Arena, menduduki puncak papan peringkat
2024-03-27 Bard (Gemini Pro) 1203.0Elo Benchmark LMSYS peringkat Claude 3 Opus di atas dengan rating Elo 1253
2024-03-27 GPT-4 preview models 1251.0Elo Benchmark LMSYS peringkat Claude 3 Opus di atas dengan rating Elo 1253
2024-03-27 GPT-4–0314 1185.0Elo Benchmark LMSYS peringkat Claude 3 Opus di atas dengan rating Elo 1253
2024-03-27 Claude 3 Sonnet 1198.0Elo Benchmark LMSYS peringkat Claude 3 Opus di atas dengan rating Elo 1253
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo Benchmark LMSYS peringkat Claude 3 Opus di atas dengan rating Elo 1253
2024-03-27 Mistral-Large-2402 1157.0Elo Benchmark LMSYS peringkat Claude 3 Opus di atas dengan rating Elo 1253
2024-03-27 Claude 3 Opus 1253.0Elo Benchmark LMSYS peringkat Claude 3 Opus di atas dengan rating Elo 1253