Benchmark · general
LMSYS Arena (Elo)
يقيس LMSYS Chatbot Arena مدى جودة روبوتات الدردشة الذكية في المحادثة المفتوحة عبر جعل أشخاص حقيقيين يقارنون نموذجين مجهولين جنبًا إلى جنب. تُجمَّع النتائج في تصنيف Elo، وهو رقم المهارة النسبية نفسه المستخدم في الشطرنج (نحو 1000-1500+).
اقرأ المزيد
- مثال
- يكتب الزائر طلبًا حرًّا — مثل «اشرح التشابك الكمي لطفل عمره 10 سنوات» أو «اكتب دالة Python لعكس قائمة مترابطة (linked list)» — ثم يرى إجابتَي نموذجين مخفيّين ويختار الأفضل.
- طريقة التقييم
- كل تصويت أعمى هو فوز/خسارة/تعادل ثنائي؛ تُجمَّع هذه الأصوات من عدد كبير من المستخدمين وتُحوَّل إلى درجة Elo، حيث يعني الرقم الأعلى أن النموذج يفوز في عدد أكبر من مبارياته.
- التحقق
- لا توجد اختبارات آلية ولا إجابات مرجعية — تُحسَم النتيجة فقط بأصوات التفضيل البشري الجماعية، وتُدلى بشكل أعمى حتى لا تؤثر أسماء العلامات التجارية في الاختيار.
- لماذا يهم
- لأنه يعكس الحكم الذاتي لمستخدمين حقيقيين على طلبات يومية بدلاً من مجموعة اختبارات ثابتة، فهو لوحة صدارة واسعة المتابعة ويصعب التلاعب بها لقياس جودة روبوتات الدردشة بشكل عام.
مثال محلول
المهمة
موجَّه Chatbot Arena (مفتوح، نموذجان يُقارنان جنبًا إلى جنب): «اشرح الفرق بين TCP وUDP لطفل فضولي عمره 10 سنوات باستخدام تشبيه بسيط، ثم اذكر تطبيقًا يوميًا واحدًا يعتمد على كل منهما». يجيب نموذجان مجهولان على المُوجَّه نفسه وتصوّت أنت للإجابة الأفضل.
الحل
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
الشرح
تُعدّ الإجابة جيدة لأنها دقيقة تقنيًا (TCP = موثوق ومرتّب، UDP = سريع ودون ضمان)، وتستخدم تشبيهًا واحدًا مناسبًا للعمر، وتغطي الجزأين المطلوبين (تطبيق لكل منهما). التقييم: لا توجد إجابة مرجعية — يجيب نموذجان مجهولان على المُوجَّه نفسه، ويختار إنسان الإجابة الأفضل، وتُجمَّع الأصوات الزوجية في لوحة تصنيف Elo/Bradley-Terry.