벤치마크 · coding

LiveCodeBench

20 결과 18 모델

LiveCodeBench는 대규모 언어 모델이 competitive programming 문제를 얼마나 잘 푸는지 평가하며, 학습 데이터 오염을 피하기 위해 최근 대회에서 지속적으로 수집한 코딩 문제를 사용합니다. 핵심 지표는 pass@1로, 모델이 첫 시도에서 정확히 풀어낸 문제의 비율입니다.

자세히 보기
예시
전형적인 항목은 대회 스타일의 코딩 문제입니다. 예를 들어 정수 배열이 주어졌을 때 가장 긴 순증가 부분 수열의 길이를 반환하는 함수를 작성하는 문제를, 모델이 동작하는 코드를 생성해 풀어야 합니다.
채점 방식
생성된 각 해답은 해당 문제의 테스트 케이스로 실행되며, pass@1은 모델의 첫 제출이 모든 테스트를 통과한 문제의 비율입니다.
검증 방식
생성된 코드가 그 문제의 모든 비공개 및 공개 테스트 케이스를 통과하면 해답이 자동으로 인정됩니다. 사람의 심사나 정확한 텍스트 일치는 사용되지 않습니다.
왜 중요한가
문제가 모델의 학습 마감 이후에 공개된 대회에서 나오기 때문에, LiveCodeBench는 암기한 답이 아니라 실제 추론 및 코딩 능력을 측정하며, 따라서 오염에 강한 신뢰할 수 있는 코딩 실력 지표가 됩니다.
예제 풀이
문제
경쟁 프로그래밍 형식(stdin/stdout). n개의 정수가 주어질 때, i < j이면서 nums[i] + nums[j]가 짝수인 쌍 (i, j)의 개수를 세시오. 입력: 첫 줄에 n, 둘째 줄에 공백으로 구분된 n개의 정수; 그 개수를 출력하시오.
해답
import sys

def main():
    data = sys.stdin.read().split()
    n = int(data[0])
    nums = list(map(int, data[1:1 + n]))
    odd = sum(x % 2 for x in nums)
    even = n - odd
    print(odd * (odd - 1) // 2 + even * (even - 1) // 2)

main()
풀이
합이 짝수인 것은 두 수의 홀짝성이 같을 때뿐이므로 답은 C(evens, 2) + C(odds, 2)이며, 홀짝을 세는 데 O(n)이 든다. LiveCodeBench는 모델의 프로그램을 숨겨진 단위 테스트로 실행해 pass@1로 채점한다 — 모든 테스트를 통과해야만 정답으로 인정된다.
0 23 46 69 92 2024-07-15 2025-07-10 2026-07-06 Qwen2-72B-Instruct · 35.7 · 2024-07-15 Qwen2-72B-Instruct · 35.7 · 2024-07-15 QwQ-32B-Preview · 50 · 2024-11-28 DeepSeek-R1-Distill-Qwen-32B · 57.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 47.3 · 2025-01-22 Grok 3 (Think) · 79.4 · 2025-02-19 Grok 3 mini · 80.4 · 2025-02-19 Grok 3 · 79.4 · 2025-03-11 DeepSeek-V3-0324 · 49.2 · 2025-03-24 Gemini 2.5 Pro · 70.4 · 2025-03-26 Gemini 2.0 Flash · 34.5 · 2025-04-15 Qwen3-235B-A22B · 70.7 · 2025-05-14 Deepseek-R1-0528 · 73.3 · 2025-05-30 Kimi K2 · 53.7 · 2025-07-28 Kimi K2 · 53.7 · 2025-07-28 GLM-4.6 · 82.8 · 2025-09-30 Kimi K2 Thinking · 83.1 · 2025-11-07 Step 3.5 Flash · 86.4 · 2026-02-10 Grok 4 · 81.9 · 2026-02-25 Agents-A1 · 44.3 · 2026-07-06
Qwen2-72B-Instruct QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 mini Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro Gemini 2.0 Flash Qwen3-235B-A22B Deepseek-R1-0528 Kimi K2 GLM-4.6 Kimi K2 Thinking Step 3.5 Flash Grok 4 Agents-A1
타임라인
날짜 모델 점수 출처
2026-07-06 Agents-A1 44.3pts 파라미터가 아닌 에이전트 지평 확장: 35B 에이전트로 트릴리언 파라미터 성능 달성
2026-02-25 Grok 4 81.9% xAI, 강력한 에이전트 및 코딩 벤치마크를 갖춘 Grok 4 추론 모델 출시
2026-02-10 Step 3.5 Flash 86.4% 단계 3.5 Flash: 11B 활성 MoE 모델이 최전선 에이전트 성능 달성
2025-11-07 Kimi K2 Thinking 83.1% Moonshot AI, 오픈소스 1T 파라미터 추론 모델 Kimi K2 Thinking 출시
2025-09-30 GLM-4.6 82.8% Zhipu AI, 에이전트 기능과 128k 컨텍스트 윈도우를 갖춘 GLM-4.6 출시
2025-07-28 Kimi K2 53.7% Kimi K2: 1조 파라미터와 MuonClip 옵티마이저를 갖춘 오픈 MoE 모델
2025-07-28 Kimi K2 53.7% Moonshot, 32B 활성화 파라미터를 가진 오픈 에이전트 MoE 모델 Kimi K2 출시
2025-05-30 Deepseek-R1-0528 73.3% DeepSeek, 향상된 추론 및 벤치마크 점수로 R1 모델 업데이트
2025-05-14 Qwen3-235B-A22B 70.7% Qwen3가 통합 사고 모드와 119개 언어 지원을 도입하다
2025-04-15 Gemini 2.0 Flash 34.5% 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시
2025-03-26 Gemini 2.5 Pro 70.4% 구글, 100만 토큰 컨텍스트를 지원하는 실험용 Gemini 2.5 Pro 추론 모델 출시
2025-03-24 DeepSeek-V3-0324 49.2% DeepSeek-V3-0324은 DeepSeek-V3 대비 추론, 코딩, 중국어 작문 능력을 향상
2025-03-11 Grok 3 79.4% xAI, 심층 추론과 백만 토큰 컨텍스트를 갖춘 Grok 3 출시
2025-02-19 Grok 3 (Think) 79.4% xAI가 Grok 3 베타 및 DeepSearch 에이전트 출시
2025-02-19 Grok 3 mini 80.4% xAI가 Grok 3 베타 및 DeepSearch 에이전트 출시
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 57.2% DeepSeek, 강화학습을 통해 R1 추론 모델 출시
2025-01-22 Kimi k1.5 (short-CoT) 47.3% Kimi k1.5는 LLM을 활용한 강화학습 스케일링으로 o1과 동등한 성능을 달성하고 짧은-CoT 모델을 압도한다
2024-11-28 QwQ-32B-Preview 50.0% Qwen, 실험적 추론 모델 QwQ-32B-Preview 출시
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시
2024-07-15 Qwen2-72B-Instruct 35.7% Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개