Benchmark · general

LMSYS Arena (Elo)

23 نتائج 21 نماذج

يقيس LMSYS Chatbot Arena مدى جودة روبوتات الدردشة الذكية في المحادثة المفتوحة عبر جعل أشخاص حقيقيين يقارنون نموذجين مجهولين جنبًا إلى جنب. تُجمَّع النتائج في تصنيف Elo، وهو رقم المهارة النسبية نفسه المستخدم في الشطرنج (نحو 1000-1500+).

اقرأ المزيد
مثال
يكتب الزائر طلبًا حرًّا — مثل «اشرح التشابك الكمي لطفل عمره 10 سنوات» أو «اكتب دالة Python لعكس قائمة مترابطة (linked list)» — ثم يرى إجابتَي نموذجين مخفيّين ويختار الأفضل.
طريقة التقييم
كل تصويت أعمى هو فوز/خسارة/تعادل ثنائي؛ تُجمَّع هذه الأصوات من عدد كبير من المستخدمين وتُحوَّل إلى درجة Elo، حيث يعني الرقم الأعلى أن النموذج يفوز في عدد أكبر من مبارياته.
التحقق
لا توجد اختبارات آلية ولا إجابات مرجعية — تُحسَم النتيجة فقط بأصوات التفضيل البشري الجماعية، وتُدلى بشكل أعمى حتى لا تؤثر أسماء العلامات التجارية في الاختيار.
لماذا يهم
لأنه يعكس الحكم الذاتي لمستخدمين حقيقيين على طلبات يومية بدلاً من مجموعة اختبارات ثابتة، فهو لوحة صدارة واسعة المتابعة ويصعب التلاعب بها لقياس جودة روبوتات الدردشة بشكل عام.
مثال محلول
المهمة
موجَّه Chatbot Arena (مفتوح، نموذجان يُقارنان جنبًا إلى جنب): «اشرح الفرق بين TCP وUDP لطفل فضولي عمره 10 سنوات باستخدام تشبيه بسيط، ثم اذكر تطبيقًا يوميًا واحدًا يعتمد على كل منهما». يجيب نموذجان مجهولان على المُوجَّه نفسه وتصوّت أنت للإجابة الأفضل.
الحل
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
الشرح
تُعدّ الإجابة جيدة لأنها دقيقة تقنيًا (TCP = موثوق ومرتّب، UDP = سريع ودون ضمان)، وتستخدم تشبيهًا واحدًا مناسبًا للعمر، وتغطي الجزأين المطلوبين (تطبيق لكل منهما). التقييم: لا توجد إجابة مرجعية — يجيب نموذجان مجهولان على المُوجَّه نفسه، ويختار إنسان الإجابة الأفضل، وتُجمَّع الأصوات الزوجية في لوحة تصنيف Elo/Bradley-Terry.
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-07-24 Kimi K3 1679.0Elo إطلاق كيمي K3 كأضخم نموذج ذي أوزان مفتوحة؛ إصدار ميوس سبارك 1.1
2026-07-24 Claude Fable 5 1760.0Elo إطلاق كيمي K3 كأضخم نموذج ذي أوزان مفتوحة؛ إصدار ميوس سبارك 1.1
2026-07-24 GPT-5.6 Sol 1743.0Elo إطلاق كيمي K3 كأضخم نموذج ذي أوزان مفتوحة؛ إصدار ميوس سبارك 1.1
2026-02-05 Claude Opus 4.6 1606.0Elo أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
2025-11-18 Gemini 3 Pro 1501.0Elo جوجل تطلق Gemini 3 Pro بقدرة reasoning متعددة الوسائط متقدمة
2025-11-18 Gemini 3 Pro 1501.0Elo جوجل تطلق Gemini 3 Pro بقدرات استدلال متعددة الوسائط متقدمة
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI تطلق Grok 4.1، متصدرة قائمة LMArena مع تقليل الهلوسة
2025-06-05 Gemini 2.5 06-05 1470.0Elo جوجل تطلق النسخة التجريبية من جيميناي 2.5 بتاريخ 06-05 بترقيات في البرمجة والاستدلال
2025-06-05 Gemini 2.5 Pro 1470.0Elo جوجل تقدم نسخة تجريبية محدثة من Gemini 2.5 Pro مع تحسينات في البرمجة والاستدلال
2025-05-20 Gemini 2.5 Pro 1415.0Elo جوجل ديب مايند تُحدّث جيميوني 2.5 بوضع التفكير العميق، والإخراج الصوتي، واستخدام الحاسوب
2025-02-19 Grok 3 1402.0Elo xAI تطلق النسخة التجريبية من Grok 3 ووكيل DeepSearch
2025-02-18 Grok-3 1402.0Elo غروك-3 من xAI يصبح أول نموذج يتجاوز 1400 في ساحة روبوتات الدردشة
2024-12-09 Gemini-Exp-1206 1379.0Elo نموذج Gemini-Exp-1206 من جوجل يتفوق على ChatGPT في لوحة المتصدرين LMArena
2024-11-15 Gemini-Exp-1114 1344.0Elo Gemini-Exp-1114 من جوجل تحتل المرتبة الأولى المشتركة على Chatbot Arena
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo نموذج Gemini 1.5 Pro 0801 التجريبي من جوجل يتفوق على GPT-4o في LMSYS Chatbot Arena
2024-05-15 GPT-4o 1309.0Elo اختبارت OpenAI سرًا لـ GPT-4o في ساحة Chatbot، متصدرًا القائمة
2024-03-27 Bard (Gemini Pro) 1203.0Elo تصنيف LMSYS يضع Claude 3 Opus في المرتبة الأولى بتقييم Elo يبلغ 1253
2024-03-27 GPT-4 preview models 1251.0Elo تصنيف LMSYS يضع Claude 3 Opus في المرتبة الأولى بتقييم Elo يبلغ 1253
2024-03-27 GPT-4–0314 1185.0Elo تصنيف LMSYS يضع Claude 3 Opus في المرتبة الأولى بتقييم Elo يبلغ 1253
2024-03-27 Claude 3 Sonnet 1198.0Elo تصنيف LMSYS يضع Claude 3 Opus في المرتبة الأولى بتقييم Elo يبلغ 1253
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo تصنيف LMSYS يضع Claude 3 Opus في المرتبة الأولى بتقييم Elo يبلغ 1253
2024-03-27 Mistral-Large-2402 1157.0Elo تصنيف LMSYS يضع Claude 3 Opus في المرتبة الأولى بتقييم Elo يبلغ 1253
2024-03-27 Claude 3 Opus 1253.0Elo تصنيف LMSYS يضع Claude 3 Opus في المرتبة الأولى بتقييم Elo يبلغ 1253