벤치마크 · coding
Codeforces (Elo)
Codeforces (Elo)는 시간 제한이 있는 대회 문제를 풀게 하여 모델의 경쟁 프로그래밍 능력을 측정하며, 결과를 Codeforces Elo 레이팅(대략 0~4000, 약 2000 이상이면 강함)으로 나타냅니다.
자세히 보기
- 예시
- 전형적인 문제는 시간 제한이 있는 알고리즘 문제입니다. 예를 들어 문제의 입력을 읽어 엄격한 시간·메모리 제한 안에서 올바른 답을 출력하는 것으로, 그래프 탐색·동적 계획법·그리디 알고리즘 같은 기법을 사용합니다.
- 채점 방식
- 결과는 하나의 Elo 숫자로, 모델이 푼 대회 문제의 수와 난이도를 바탕으로 계산되며 Codeforces가 인간 참가자에게 사용하는 것과 같은 레이팅 척도 위에 놓입니다.
- 검증 방식
- 제출된 각 해답은 자동으로 채점됩니다. 코드는 컴파일되어 숨겨진 테스트 케이스 묶음에 대해 실행되며, 시간·메모리 제한 안에서 올바른 출력을 내야만 통과로 인정됩니다.
- 왜 중요한가
- 여러 단계를 거치는 알고리즘적 추론과 제약 속에서 정확하고 효율적인 코드를 작성하는 능력을 반영하며, 모델의 코딩 실력을 사람들이 이미 이해하는 레이팅 척도에 대응시킵니다.
예제 풀이
문제
Watermelon: 정수 w (1 ≤ w ≤ 100)가 수박의 무게로 주어진다. 각 부분이 양의 짝수 킬로그램이 되도록 두 부분으로 나눌 수 있는지 판정하고 «YES» 또는 «NO»를 출력하라.
해답
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
풀이
두 양의 짝수의 합은 그 자체로 짝수이며 최소 4이므로, w가 짝수이고 w > 2일 때만 유효한 분할이 존재한다(예: w=8 → 2+6). Codeforces는 제출물을 컴파일하여 숨겨진 테스트 케이스로 실행하며, 시간과 메모리 제한 내에서 stdout 출력이 기댓값과 정확히 일치할 것을 요구해 채점한다.
| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2026-07-16 | GFlowRL | 2048.0Elo | Microsoft, 대규모 언어 모델을 위한 안정적인 GFlowNet 스타일 RL인 GFlowRL 출시 |
| 2026-02-12 | Gemini 3 Deep Think | 3455.0Elo | 구글, 새로운 벤치마크 점수를 갖춘 Gemini 3 Deep Think 출시 |
| 2025-05-14 | Qwen3-235B-A22B | 2056.0Elo | Qwen3가 통합 사고 모드와 119개 언어 지원을 도입하다 |
| 2025-04-17 | o4-mini | 2719.0Elo | OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시 |
| 2025-01-22 | DeepSeek-R1 | 2029.0Elo | DeepSeek, 강화학습을 통해 R1 추론 모델 출시 |
| 2025-01-02 | QwQ-32B-Preview | 1261.0Elo | CodeElo가 인간과 비교 가능한 Elo 등급을 갖춘 경쟁 수준 코드 생성 벤치마크를 선보임 |
| 2025-01-02 | o1-mini | 1578.0Elo | CodeElo가 인간과 비교 가능한 Elo 등급을 갖춘 경쟁 수준 코드 생성 벤치마크를 선보임 |
| 2024-12-20 | o3 | 2727.0Elo | OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시 |
| 2024-10-01 | OpenAI o1-preview | 89.0Elo | OpenAI o1과 기타 상위 모델 비교 |
| 2024-09-12 | o1 | 1807.0Elo | OpenAI가 수학 및 과학 벤치마크에서 인간 전문가를 능가하는 추론 모델 o1-preview 출시 |