Benchmark · general
LMSYS Arena (Elo)
LMSYS Chatbot Arena यह मापता है कि AI चैटबॉट खुली बातचीत में कितने अच्छे हैं, इसके लिए असली लोग दो गुमनाम मॉडलों की आमने-सामने तुलना करते हैं। परिणामों को Elo रेटिंग में जोड़ा जाता है — वही सापेक्ष-कौशल संख्या जो शतरंज में इस्तेमाल होती है (लगभग 1000-1500+)।
और पढ़ें
- उदाहरण
- एक आगंतुक कोई भी खुला प्रॉम्प्ट लिखता है — जैसे «10 साल के बच्चे को क्वांटम उलझाव समझाओ» या «linked list को उलटने के लिए Python फ़ंक्शन लिखो» — दो छिपे हुए मॉडलों के जवाब देखता है और बेहतर जवाब चुनता है।
- स्कोरिंग
- हर गुप्त वोट एक जोड़ी में जीत/हार/बराबरी होता है; इन वोटों को कई उपयोगकर्ताओं से इकट्ठा करके Elo स्कोर में बदला जाता है, जहाँ बड़ी संख्या का मतलब है कि मॉडल अपने मुकाबलों में ज़्यादा जीतता है।
- सत्यापन
- यहाँ कोई स्वचालित परीक्षण या संदर्भ उत्तर नहीं होते — परिणाम पूरी तरह भीड़-स्रोत मानव पसंद के वोटों से तय होता है, जो गुप्त रूप से डाले जाते हैं ताकि ब्रांड का नाम चुनाव को प्रभावित न कर सके।
- यह क्यों मायने रखता है
- क्योंकि यह किसी तय परीक्षण-सेट के बजाय रोज़मर्रा के प्रॉम्प्ट पर असली उपयोगकर्ताओं की व्यक्तिपरक राय दर्शाता है, यह चैटबॉट की समग्र गुणवत्ता के लिए एक व्यापक रूप से देखा जाने वाला और मुश्किल-से-हेरफेर होने वाला लीडरबोर्ड है।
हल किया गया उदाहरण
कार्य
Chatbot Arena प्रॉम्प्ट (खुला, दो मॉडल आमने-सामने तुलना): «एक जिज्ञासु 10 साल के बच्चे को एक सरल उपमा के ज़रिए TCP और UDP का अंतर समझाइए, फिर हर एक पर निर्भर एक-एक रोज़मर्रा का ऐप बताइए।» दो गुमनाम मॉडल एक ही प्रॉम्प्ट का उत्तर देते हैं और आप बेहतर उत्तर के लिए वोट करते हैं।
समाधान
Strong reply: 'TCP = numbered letters the post office confirms and resends if lost, so everything arrives in order — web browsing, email. UDP = shouting across a playground: fast, but missed words are never resent — video calls, online games.' No single gold answer exists; the winner is whichever reply a human rates more helpful, accurate, and clear.
व्याख्या
उत्तर को अच्छा माना जाता है क्योंकि यह तकनीकी रूप से सही है (TCP = भरोसेमंद और क्रमबद्ध, UDP = तेज़, best-effort), उम्र के अनुकूल एक उपमा इस्तेमाल करता है, और दोनों माँगे गए हिस्से पूरे करता है (हर एक के लिए एक ऐप)। मूल्यांकन: कोई मानक उत्तर नहीं होता — दो गुमनाम मॉडल एक ही प्रॉम्प्ट का उत्तर देते हैं, एक व्यक्ति बेहतर उत्तर चुनता है, और जोड़ीवार वोट Elo/Bradley-Terry लीडरबोर्ड में जुड़ जाते हैं।