يقدم الباحثون CodeElo، وهو معيار موحد مصمم لتقييم قدرات البرمجة على مستوى المسابقات في نماذج اللغة الكبيرة من خلال مواءمته مع منصة CodeForces الرسمية. يعالج المعيار قيود الأدوات الحالية باستخدام مشاكل مسابقات حقيقية، ودعم الحكام الخاصين، وتوفير نظام تقييم إيلو قابل للمقارنة مع المشاركين البشر.
- يجمع CodeElo بين مشاكل مسابقات CodeForces الأخيرة مع تفاصيل حول الفئات، وتقييمات الصعوبة، ووسوم الخوارزميات.
- تُرفع المشاكل مباشرة إلى المنصة للحكم عليها، مما يضمن مواءمة بيئة التنفيذ.
- يوفر الدراسة تقييمات إيلو لأول مرة لـ 30 نموذجاً لغوياً كبيراً مفتوح المصدر و3 مملوكة.
- تظهر النتائج أن o1-mini (1578) وQwQ-32B-Preview (1261) يتفوقان بشكل ملحوظ على النماذج الأخرى، التي تواجه صعوبة حتى في أبسط المشاكل.
يوفر هذا المعيار طريقة موثوقة لتقييم قدرات الاستدلال البرمجي المتقدمة ويوفر رؤى حول أداء النماذج عبر خوارزميات ولغات برمجة مختلفة.