LMSYS के शोधकर्ताओं ने बड़े भाषा मॉडलों की तुलना करने के लिए एक ईलो रेटिंग सिस्टम का उपयोग करते हुए एक लीडरबोर्ड जारी किया है, जिससे पता चला कि Anthropic का क्लॉड 3 ओपस शीर्ष स्थान पर आ गया है। मॉडल ने मानव वोटर्स द्वारा मूल्यांकन किए गए हेड-टू-हेड ब्रेवल के आधार पर 1253 की ईलो रेटिंग हासिल की।

  • क्लॉड 3 ओपस कुल 33,250 वोटों और +5/-5 रिकॉर्ड के साथ उच्चतम रेटिंग रखता है।
  • OpenAI के GPT-4 प्रीव्यू मॉडल 1251 और 1248 रेटिंग के साथ करीब से आगे हैं।
  • Google का Bard (Gemini Pro) 1203 की ईलो रेटिंग के साथ चौथे स्थान पर है।
  • पुराना GPT-4–0314 मॉडल 1185 रेटिंग के साथ छठे स्थान पर है।

यह बेंचमार्क भाषा AI में तेजी से प्रगति को ट्रैक करने और मुख्य टेक कंपनियों के बीच प्रतिस्पर्धा बढ़ने के साथ अग्रणी आर्किटेक्चर की पहचान करने के लिए एक वस्तुनिष्ठ विधि प्रदान करता है।