Benchmark · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena mengukur seberapa baik chatbot AI dalam percakapan terbuka dengan meminta orang sungguhan membandingkan dua model anonim secara berdampingan. Hasilnya digabungkan menjadi peringkat Elo, angka keterampilan relatif yang sama seperti yang dipakai dalam catur (sekitar 1000-1500+).
Selengkapnya
- Contoh
- Seorang pengunjung mengetik perintah bebas — misalnya «Jelaskan keterjeratan kuantum kepada anak berusia 10 tahun» atau «Tulis fungsi Python untuk membalik linked list» — melihat dua model tersembunyi menjawab, lalu memilih jawaban yang lebih baik.
- Penilaian
- Setiap suara buta adalah menang/kalah/seri secara berpasangan; suara-suara ini dikumpulkan dari banyak pengguna dan diubah menjadi skor Elo, di mana angka yang lebih tinggi berarti model itu lebih sering menang dalam pertandingannya.
- Verifikasi
- Tidak ada tes otomatis atau jawaban acuan — hasilnya ditentukan murni oleh suara preferensi manusia dari banyak orang, diberikan secara buta agar nama merek tidak memengaruhi pilihan.
- Mengapa penting
- Karena mencerminkan penilaian subjektif pengguna nyata atas perintah sehari-hari alih-alih kumpulan tes yang tetap, ini adalah papan peringkat kualitas chatbot secara keseluruhan yang banyak diperhatikan dan sulit dicurangi.
Contoh penyelesaian
Tugas
Prompt Chatbot Arena (terbuka, dua model dibandingkan berdampingan): «Jelaskan perbedaan antara TCP dan UDP kepada anak berusia 10 tahun yang penasaran menggunakan analogi sederhana, lalu sebutkan satu aplikasi sehari-hari yang mengandalkan masing-masing.» Dua model anonim menjawab prompt yang sama dan kamu memilih jawaban yang lebih baik.
Solusi
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
Penjelasan
Jawaban dinilai baik karena secara teknis akurat (TCP = andal dan berurutan, UDP = cepat, best-effort), memakai satu analogi yang sesuai usia, dan mencakup kedua bagian yang diminta (satu aplikasi untuk masing-masing). Penilaian: tidak ada jawaban acuan — dua model anonim menjawab prompt yang sama, seorang manusia memilih jawaban yang lebih baik, dan suara berpasangan digabungkan menjadi papan peringkat Elo/Bradley-Terry.