أطلق باحثو LMSYS لوحة متصدرين تستخدم نظام تقييم Elo لمقارنة نماذج اللغة الكبيرة، وكشفوا أن Claude 3 Opus من Anthropic قد استحوذ على المركز الأول. حقق النموذج تقييم Elo يبلغ 1253 بناءً على معارك فردية ضد بعضها البعض تم تقييمها بواسطة ناخبين بشريين.
- يحتفظ Claude 3 Opus بأعلى تقييم بـ 33,250 صوتًا إجماليًا وسجل +5/-5.
- تتبع نماذج GPT-4 الأولية من OpenAI عن كثب بتقييمات 1251 و 1248.
- تحتل Bard (Gemini Pro) من Google المرتبة الرابعة بتقييم Elo يبلغ 1203.
- يصنف النموذج الأقدم GPT-4–0314 في المركز السادس بتقييم 1185.
يوفر هذا المعيار طريقة موضوعية لتتبع التقدم السريع في ذكاء اللغة وتحديد البنى الرائدة مع اشتداد المنافسة بين شركات التكنولوجيا الكبرى.