शोधकर्ताओं ने CodeElo पेश किया, एक मानकीकृत बेंचमार्क जिसे आधिकारिक CodeForces प्लेटफ़ॉर्म के साथ संरेखित करके बड़े भाषा मॉडलों की प्रतियोगिता-स्तर की कोडिंग क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह बेंचमार्क वास्तविक प्रतियोगिता समस्याओं का उपयोग करके, विशेष जजों का समर्थन करके और मानवीय प्रतिभागियों के तुलनीय Elo रेटिंग प्रणाली प्रदान करके मौजूदा उपकरणों की सीमाओं को दूर करता है।
- CodeElo विभिन्न डिविज़नों, कठिनाई रेटिंग्स और एल्गोरिदम टैग्स के साथ हालिया CodeForces प्रतियोगिता समस्याओं को संकलित करता है।
- समस्याओं का मूल्यांकन प्लेटफ़ॉर्म पर सीधे जमा किया जाता है, जिससे निष्पादन वातावरण का संरेखण सुनिश्चित होता है।
- अध्ययन में पहली बार 30 ओपन-सोर्स और 3 प्रोप्राइटरी LLMs के लिए Elo रेटिंग्स प्रदान की गई हैं।
- परिणाम दिखाते हैं कि o1-mini (1578) और QwQ-32B-Preview (1261) अन्य मॉडलों से काफी बेहतर प्रदर्शन करते हैं, जो सबसे आसान समस्याओं में भी संघर्ष करते हैं।
यह बेंचमार्क उन्नत कोड तर्क क्षमताओं का मूल्यांकन करने के लिए एक विश्वसनीय विधि प्रदान करता है और विभिन्न एल्गोरिदम और प्रोग्रामिंग भाषाओं में मॉडल प्रदर्शन पर अंतर्दृष्टि प्रदान करता है।