Para peneliti memperkenalkan CodeElo, sebuah benchmark terstandarisasi yang dirancang untuk mengevaluasi kemampuan coding tingkat kompetisi dari model bahasa besar dengan menyelaraskannya dengan platform resmi CodeForces. Benchmark ini mengatasi keterbatasan dalam alat-alat yang ada dengan menggunakan masalah kontes nyata, mendukung hakim khusus, dan menyediakan sistem peringkat Elo yang sebanding dengan peserta manusia.
- CodeElo mengumpulkan masalah kontes CodeForces terbaru dengan rincian divisi, peringkat kesulitan, dan tag algoritma.
- Masalah dikirim langsung ke platform untuk penilaian, memastikan keselarasan lingkungan eksekusi.
- Studi ini memberikan peringkat Elo untuk 30 LLM sumber terbuka dan 3 LLM komersial untuk pertama kalinya.
- Hasil menunjukkan o1-mini (1578) dan QwQ-32B-Preview (1261) secara signifikan mengungguli model lain, yang kesulitan bahkan dengan masalah termudah.
Benchmark ini menawarkan metode andal untuk menilai kemampuan penalaran kode yang canggih dan memberikan wawasan tentang kinerja model di berbagai algoritma dan bahasa pemrograman.