벤치마크 · math

FrontierMath

20 결과 15 모델

FrontierMath는 Epoch AI가 만든 벤치마크로, AI 모델이 극도로 어렵고 독창적인 연구 수준의 수학 문제를 얼마나 잘 푸는지를 측정한다. 점수는 모델이 정답을 맞힌 문제의 비율이며, 현재 모델들은 극히 일부만 풀 수 있어 포화와는 거리가 멀다.

자세히 보기
예시
정수론(number theory), 대수기하학, 조합론 같은 고급 분야에서 나온, 이전에 공개된 적 없는 한 문제로, 풀이에 깊은 전문 지식이 필요하며 최종적으로 하나의 확정된 답(예: 특정 정수나 정확한 수학적 대상)으로 귀결된다.
채점 방식
지표는 정확도(accuracy)로, 최종 답이 기준 답과 정확히 일치하는 문제의 비율을 백분율로 나타낸다.
검증 방식
각 문제에는 자동으로 검증 가능한 하나의 확정된 답이 있어, 기준 답과 정확히 일치할 때만 정답으로 인정된다. 문제는 전문 수학자들이 찍어서 맞히기 거의 불가능하도록 설계한다.
왜 중요한가
문제가 새롭기 때문에 암기가 통하지 않고 지금도 정복과는 거리가 멀어서, 진짜 고급 수학적 추론과 패턴 매칭을 여전히 뚜렷이 구분해 내는 몇 안 되는 수학 벤치마크 중 하나다.
예제 풀이
문제
$0 \le n < 3^{13}$ 이고 중심 이항계수 $\binom{2n}{n}$ 이 $3$ 으로 나누어떨어지지 않는 정수 $n$ 의 개수를 구하여라.
해답
Kummer 정리에 의해, $3 \nmid \binom{2n}{n}$ 인 것은 3진법에서 $n+n$ 을 더할 때 받아올림이 없는 경우, 즉 $n$ 의 모든 3진 자릿수가 0 또는 1인 경우와 정확히 일치한다. $0 \le n < 3^{13}$ 범위에서 이는 13개 자릿수 각각에 2가지 선택을 주므로 개수는 $2^{13} = 8192$ 이다.
풀이
Kummer 정리는 $v_3\binom{2n}{n}$ 을 3진법에서 $n$ 을 자기 자신과 더할 때의 받아올림 횟수로 준다. 받아올림이 0이려면 각 3진 자릿수가 0 또는 1이어야 하므로, 13개 자릿수에서 자릿수당 2가지이다. 채점: 자동 채점기가 유일한 최종 정수(8192)를 정확히 대조한다.
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
타임라인
날짜 모델 점수 출처
2026-04-25 GPT-5.5 51.7% OpenAI, 네이티브 오미모달 처리를 갖춘 GPT-5.5 출시
2026-04-23 GPT-5.5 Pro 39.6% OpenAI, 에이전트 기능과 두 배의 API 가격으로 GPT-5.5 출시
2026-04-23 GPT-5.5 35.4% OpenAI, 에이전트 기능과 두 배의 API 가격으로 GPT-5.5 출시
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro, FrontierMath Tier 4에서 31% 달성
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI, 과학 및 수학용 GPT-5.2 Pro 및 Thinking 모델 출시
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI, 프론티어 데이터 센터 허브 출시 및 OSWorld 벤치마크 분석
2025-12-04 Gemini 3 Pro 38.0% Epoch AI, 프론티어 데이터 센터 허브 출시 및 OSWorld 벤치마크 분석
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro가 FrontierMath Tier 4 문제 해결, Gemini 2.5 Deep Think에 근소한 우위
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI, Gemini 2.5 Deep Think의 수학 능력 평가
2025-04-20 o3 10.0% OpenAI의 o3, FrontierMath에서 초기 주장보다 낮은 점수 기록
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% FrontierMath에서 Epoch의 o3-mini 평가는 11%로 OpenAI의 32% 대비 낮음
2025-01-29 o3 25.0% OpenAI의 o3 모델, Frontier Math 벤치마크에서 25% 점수 달성
2025-01-19 o3 25.2% OpenAI가 o3의 기록 수립 전 FrontierMath 벤치마크에 자금 지원
2024-12-22 o3 25.0% OpenAI의 o3가 FrontierMath 난이도 수학 벤치마크에서 25% 점수 달성
2024-12-20 o3 25.0% OpenAI, ARC AGI 및 Frontier Math 돌파구와 함께 o3 추론 모델 미리보기
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI, 고급 수학 추론 평가를 위한 FrontierMath 벤치마크 출시
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI, 고급 수학 추론 평가를 위한 FrontierMath 벤치마크 출시
2024-11-08 GPT-4o 2.0% Epoch AI, 고급 수학 추론 평가를 위한 FrontierMath 벤치마크 출시
2024-11-08 o1-preview 2.0% Epoch AI, 고급 수학 추론 평가를 위한 FrontierMath 벤치마크 출시