Benchmark · general

LMSYS Arena (Elo)

23 परिणाम 21 मॉडल

LMSYS Chatbot Arena यह मापता है कि AI चैटबॉट खुली बातचीत में कितने अच्छे हैं, इसके लिए असली लोग दो गुमनाम मॉडलों की आमने-सामने तुलना करते हैं। परिणामों को Elo रेटिंग में जोड़ा जाता है — वही सापेक्ष-कौशल संख्या जो शतरंज में इस्तेमाल होती है (लगभग 1000-1500+)।

और पढ़ें
उदाहरण
एक आगंतुक कोई भी खुला प्रॉम्प्ट लिखता है — जैसे «10 साल के बच्चे को क्वांटम उलझाव समझाओ» या «linked list को उलटने के लिए Python फ़ंक्शन लिखो» — दो छिपे हुए मॉडलों के जवाब देखता है और बेहतर जवाब चुनता है।
स्कोरिंग
हर गुप्त वोट एक जोड़ी में जीत/हार/बराबरी होता है; इन वोटों को कई उपयोगकर्ताओं से इकट्ठा करके Elo स्कोर में बदला जाता है, जहाँ बड़ी संख्या का मतलब है कि मॉडल अपने मुकाबलों में ज़्यादा जीतता है।
सत्यापन
यहाँ कोई स्वचालित परीक्षण या संदर्भ उत्तर नहीं होते — परिणाम पूरी तरह भीड़-स्रोत मानव पसंद के वोटों से तय होता है, जो गुप्त रूप से डाले जाते हैं ताकि ब्रांड का नाम चुनाव को प्रभावित न कर सके।
यह क्यों मायने रखता है
क्योंकि यह किसी तय परीक्षण-सेट के बजाय रोज़मर्रा के प्रॉम्प्ट पर असली उपयोगकर्ताओं की व्यक्तिपरक राय दर्शाता है, यह चैटबॉट की समग्र गुणवत्ता के लिए एक व्यापक रूप से देखा जाने वाला और मुश्किल-से-हेरफेर होने वाला लीडरबोर्ड है।
हल किया गया उदाहरण
कार्य
Chatbot Arena प्रॉम्प्ट (खुला, दो मॉडल आमने-सामने तुलना): «एक जिज्ञासु 10 साल के बच्चे को एक सरल उपमा के ज़रिए TCP और UDP का अंतर समझाइए, फिर हर एक पर निर्भर एक-एक रोज़मर्रा का ऐप बताइए।» दो गुमनाम मॉडल एक ही प्रॉम्प्ट का उत्तर देते हैं और आप बेहतर उत्तर के लिए वोट करते हैं।
समाधान
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
व्याख्या
उत्तर को अच्छा माना जाता है क्योंकि यह तकनीकी रूप से सही है (TCP = भरोसेमंद और क्रमबद्ध, UDP = तेज़, best-effort), उम्र के अनुकूल एक उपमा इस्तेमाल करता है, और दोनों माँगे गए हिस्से पूरे करता है (हर एक के लिए एक ऐप)। मूल्यांकन: कोई मानक उत्तर नहीं होता — दो गुमनाम मॉडल एक ही प्रॉम्प्ट का उत्तर देते हैं, एक व्यक्ति बेहतर उत्तर चुनता है, और जोड़ीवार वोट Elo/Bradley-Terry लीडरबोर्ड में जुड़ जाते हैं।
1000 1250 1500 1750 2000 2024-03-27 2025-05-25 2026-07-24 Bard (Gemini Pro) · 1203 · 2024-03-27 GPT-4 preview models · 1251 · 2024-03-27 GPT-4–0314 · 1185 · 2024-03-27 Claude 3 Sonnet · 1198 · 2024-03-27 Qwen1.5–72B-Chat · 1148 · 2024-03-27 Mistral-Large-2402 · 1157 · 2024-03-27 Claude 3 Opus · 1253 · 2024-03-27 GPT-4o · 1309 · 2024-05-15 Gemini 1.5 Pro 0801 · 1300 · 2024-08-02 Gemini-Exp-1114 · 1344 · 2024-11-15 Gemini-Exp-1206 · 1379 · 2024-12-09 Grok-3 · 1402 · 2025-02-18 Grok 3 · 1402 · 2025-02-19 Gemini 2.5 Pro · 1415 · 2025-05-20 Gemini 2.5 Pro · 1470 · 2025-06-05 Gemini 2.5 06-05 · 1470 · 2025-06-05 Grok4.1 (Thinking) · 1510 · 2025-11-17 Gemini 3 Pro · 1501 · 2025-11-18 Gemini 3 Pro · 1501 · 2025-11-18 Claude Opus 4.6 · 1606 · 2026-02-05 Kimi K3 · 1679 · 2026-07-24 Claude Fable 5 · 1760 · 2026-07-24 GPT-5.6 Sol · 1743 · 2026-07-24
Bard (Gemini Pro) GPT-4 preview models GPT-4–0314 Claude 3 Sonnet Qwen1.5–72B-Chat Mistral-Large-2402 Claude 3 Opus GPT-4o Gemini 1.5 Pro 0801 Gemini-Exp-1114 Gemini-Exp-1206 Grok-3 Grok 3 Gemini 2.5 Pro Gemini 2.5 06-05 Grok4.1 (Thinking) Gemini 3 Pro Claude Opus 4.6 Kimi K3 Claude Fable 5 GPT-5.6 Sol
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-24 Kimi K3 1679.0Elo Kimi K3 सबसे बड़े ओपन-वेट मॉडल के रूप में लॉन्च हुआ; Muse Spark 1.1 जारी
2026-07-24 Claude Fable 5 1760.0Elo Kimi K3 सबसे बड़े ओपन-वेट मॉडल के रूप में लॉन्च हुआ; Muse Spark 1.1 जारी
2026-07-24 GPT-5.6 Sol 1743.0Elo Kimi K3 सबसे बड़े ओपन-वेट मॉडल के रूप में लॉन्च हुआ; Muse Spark 1.1 जारी
2026-02-05 Claude Opus 4.6 1606.0Elo Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2025-11-18 Gemini 3 Pro 1501.0Elo Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-11-18 Gemini 3 Pro 1501.0Elo Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-11-17 Grok4.1 (Thinking) 1510.0Elo xAI ने कम हैलुसिनेशन के साथ LMArena लीडरबोर्ड में शीर्ष स्थान हासिल करते हुए Grok 4.1 जारी किया
2025-06-05 Gemini 2.5 06-05 1470.0Elo Google ने कोडिंग और तर्क में सुधार के साथ Gemini 2.5 06-05 प्रीव्यू जारी किया
2025-06-05 Gemini 2.5 Pro 1470.0Elo Google ने बेहतर कोडिंग और तर्क के साथ अपग्रेडेड Gemini 2.5 Pro प्रीव्यू पेश किया
2025-05-20 Gemini 2.5 Pro 1415.0Elo Google DeepMind ने Deep Think, ऑडियो आउटपुट और कंप्यूटर उपयोग के साथ Gemini 2.5 को अपडेट किया
2025-02-19 Grok 3 1402.0Elo xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-02-18 Grok-3 1402.0Elo xAI का Grok-3 चैटबॉट एरिना में 1400 से अधिक स्कोर करने वाला पहला मॉडल बना
2024-12-09 Gemini-Exp-1206 1379.0Elo LMArena लीडरबोर्ड पर Google का Gemini-Exp-1206 ChatGPT को पछाड़ता है
2024-11-15 Gemini-Exp-1114 1344.0Elo Google का Gemini-Exp-1114 Chatbot Arena पर संयुक्त नंबर 1 पर है
2024-08-02 Gemini 1.5 Pro 0801 1300.0Elo Google का प्रायोगिक Gemini 1.5 Pro 0801, LMSYS Chatbot Arena पर GPT-4o को पार कर गया
2024-05-15 GPT-4o 1309.0Elo OpenAI ने गुप्त रूप से Chatbot Arena में GPT-4o का परीक्षण किया, लीडरबोर्ड में शीर्ष स्थान हासिल किया
2024-03-27 Bard (Gemini Pro) 1203.0Elo LMSYS बेंचमार्क ने क्लॉड 3 ओपस को 1253 ईलो रेटिंग के साथ शीर्ष पर रैंक किया
2024-03-27 GPT-4 preview models 1251.0Elo LMSYS बेंचमार्क ने क्लॉड 3 ओपस को 1253 ईलो रेटिंग के साथ शीर्ष पर रैंक किया
2024-03-27 GPT-4–0314 1185.0Elo LMSYS बेंचमार्क ने क्लॉड 3 ओपस को 1253 ईलो रेटिंग के साथ शीर्ष पर रैंक किया
2024-03-27 Claude 3 Sonnet 1198.0Elo LMSYS बेंचमार्क ने क्लॉड 3 ओपस को 1253 ईलो रेटिंग के साथ शीर्ष पर रैंक किया
2024-03-27 Qwen1.5–72B-Chat 1148.0Elo LMSYS बेंचमार्क ने क्लॉड 3 ओपस को 1253 ईलो रेटिंग के साथ शीर्ष पर रैंक किया
2024-03-27 Mistral-Large-2402 1157.0Elo LMSYS बेंचमार्क ने क्लॉड 3 ओपस को 1253 ईलो रेटिंग के साथ शीर्ष पर रैंक किया
2024-03-27 Claude 3 Opus 1253.0Elo LMSYS बेंचमार्क ने क्लॉड 3 ओपस को 1253 ईलो रेटिंग के साथ शीर्ष पर रैंक किया