أطلق باحثو LMSYS لوحة متصدرين تستخدم نظام تقييم Elo لمقارنة نماذج اللغة الكبيرة، وكشفوا أن Claude 3 Opus من Anthropic قد استحوذ على المركز الأول. حقق النموذج تقييم Elo يبلغ 1253 بناءً على معارك فردية ضد بعضها البعض تم تقييمها بواسطة ناخبين بشريين.

  • يحتفظ Claude 3 Opus بأعلى تقييم بـ 33,250 صوتًا إجماليًا وسجل +5/-5.
  • تتبع نماذج GPT-4 الأولية من OpenAI عن كثب بتقييمات 1251 و 1248.
  • تحتل Bard (Gemini Pro) من Google المرتبة الرابعة بتقييم Elo يبلغ 1203.
  • يصنف النموذج الأقدم GPT-4–0314 في المركز السادس بتقييم 1185.

يوفر هذا المعيار طريقة موضوعية لتتبع التقدم السريع في ذكاء اللغة وتحديد البنى الرائدة مع اشتداد المنافسة بين شركات التكنولوجيا الكبرى.