연구자들은 CodeElo를 소개했는데, 이는 공식 CodeForces 플랫폼과 정렬하여 대규모 언어 모델의 경쟁 수준 코딩 능력을 평가하도록 설계된 표준화된 벤치마크입니다. 이 벤치마크는 실제 대회 문제를 사용하고, 특별 판정자를 지원하며, 인간 참가자와 비교 가능한 Elo 등급 체계를 제공함으로써 기존 도구의 한계를 해결합니다.
- CodeElo는 부문, 난이도 등급 및 알고리즘 태그에 대한 세부 사항과 함께 최근 CodeForces 대회 문제를 컴파일합니다.
- 문제는 판정을 위해 플랫폼에 직접 제출되어 실행 환경의 정렬을 보장합니다.
- 이 연구는 처음으로 30개의 오픈소스 LLM과 3개의 상용 LLM에 대한 Elo 등급을 제공합니다.
- 결과에 따르면 o1-mini(1578)와 QwQ-32B-Preview(1261)이 다른 모델들을 크게 앞지르며, 다른 모델들은 가장 쉬운 문제조차 해결하는 데 어려움을 겪습니다.
이 벤치마크는 정교한 코드 추론 능력을 평가할 수 있는 신뢰할 수 있는 방법을 제공하며, 다양한 알고리즘과 프로그래밍 언어에 걸친 모델 성능에 대한 통찰력을 제공합니다.