벤치마크 · coding

Codeforces (Elo)

10 결과 10 모델

Codeforces (Elo)는 시간 제한이 있는 대회 문제를 풀게 하여 모델의 경쟁 프로그래밍 능력을 측정하며, 결과를 Codeforces Elo 레이팅(대략 0~4000, 약 2000 이상이면 강함)으로 나타냅니다.

자세히 보기
예시
전형적인 문제는 시간 제한이 있는 알고리즘 문제입니다. 예를 들어 문제의 입력을 읽어 엄격한 시간·메모리 제한 안에서 올바른 답을 출력하는 것으로, 그래프 탐색·동적 계획법·그리디 알고리즘 같은 기법을 사용합니다.
채점 방식
결과는 하나의 Elo 숫자로, 모델이 푼 대회 문제의 수와 난이도를 바탕으로 계산되며 Codeforces가 인간 참가자에게 사용하는 것과 같은 레이팅 척도 위에 놓입니다.
검증 방식
제출된 각 해답은 자동으로 채점됩니다. 코드는 컴파일되어 숨겨진 테스트 케이스 묶음에 대해 실행되며, 시간·메모리 제한 안에서 올바른 출력을 내야만 통과로 인정됩니다.
왜 중요한가
여러 단계를 거치는 알고리즘적 추론과 제약 속에서 정확하고 효율적인 코드를 작성하는 능력을 반영하며, 모델의 코딩 실력을 사람들이 이미 이해하는 레이팅 척도에 대응시킵니다.
예제 풀이
문제
Watermelon: 정수 w (1 ≤ w ≤ 100)가 수박의 무게로 주어진다. 각 부분이 양의 짝수 킬로그램이 되도록 두 부분으로 나눌 수 있는지 판정하고 «YES» 또는 «NO»를 출력하라.
해답
w = int(input())
print("YES" if w > 2 and w % 2 == 0 else "NO")
풀이
두 양의 짝수의 합은 그 자체로 짝수이며 최소 4이므로, w가 짝수이고 w > 2일 때만 유효한 분할이 존재한다(예: w=8 → 2+6). Codeforces는 제출물을 컴파일하여 숨겨진 테스트 케이스로 실행하며, 시간과 메모리 제한 내에서 stdout 출력이 기댓값과 정확히 일치할 것을 요구해 채점한다.
88 1016 1944 2872 3800 2024-09-12 2025-08-14 2026-07-16 o1 · 1807 · 2024-09-12 OpenAI o1-preview · 89 · 2024-10-01 o3 · 2727 · 2024-12-20 QwQ-32B-Preview · 1261 · 2025-01-02 o1-mini · 1578 · 2025-01-02 DeepSeek-R1 · 2029 · 2025-01-22 o4-mini · 2719 · 2025-04-17 Qwen3-235B-A22B · 2056 · 2025-05-14 Gemini 3 Deep Think · 3455 · 2026-02-12 GFlowRL · 2048 · 2026-07-16
o1 OpenAI o1-preview o3 QwQ-32B-Preview o1-mini DeepSeek-R1 o4-mini Qwen3-235B-A22B Gemini 3 Deep Think GFlowRL
타임라인
날짜 모델 점수 출처
2026-07-16 GFlowRL 2048.0Elo Microsoft, 대규모 언어 모델을 위한 안정적인 GFlowNet 스타일 RL인 GFlowRL 출시
2026-02-12 Gemini 3 Deep Think 3455.0Elo 구글, 새로운 벤치마크 점수를 갖춘 Gemini 3 Deep Think 출시
2025-05-14 Qwen3-235B-A22B 2056.0Elo Qwen3가 통합 사고 모드와 119개 언어 지원을 도입하다
2025-04-17 o4-mini 2719.0Elo OpenAI가 더 빠르고 저렴한 다중 모달 추론 모델인 o4-mini 출시
2025-01-22 DeepSeek-R1 2029.0Elo DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2025-01-02 QwQ-32B-Preview 1261.0Elo CodeElo가 인간과 비교 가능한 Elo 등급을 갖춘 경쟁 수준 코드 생성 벤치마크를 선보임
2025-01-02 o1-mini 1578.0Elo CodeElo가 인간과 비교 가능한 Elo 등급을 갖춘 경쟁 수준 코드 생성 벤치마크를 선보임
2024-12-20 o3 2727.0Elo OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시
2024-10-01 OpenAI o1-preview 89.0Elo OpenAI o1과 기타 상위 모델 비교
2024-09-12 o1 1807.0Elo OpenAI가 수학 및 과학 벤치마크에서 인간 전문가를 능가하는 추론 모델 o1-preview 출시