벤치마크 · reasoning

ARC-AGI 1

27 결과 25 모델

ARC-AGI 1은 추상적 추론과 일반화 능력을 측정합니다. 각 과제는 입력→출력 격자 예시 몇 개를 보여 주고, 푸는 쪽은 숨은 변환 규칙을 추론해 새 입력에 대한 올바른 출력 격자를 만들어야 합니다. 지표는 출력 격자가 정확히 일치해 푼 과제의 비율(퍼센트)입니다.

자세히 보기
예시
한 과제에서는 두세 개의 작은 색상 격자가 주어지고, 각 입력이 같은 규칙으로 출력으로 바뀝니다 — 예를 들어 닫힌 영역을 모두 채우거나 도형을 거울처럼 뒤집는 식으로 — 그리고 추론한 그 규칙을 처음 보는 새 격자에 적용해야 합니다.
채점 방식
만들어 낸 격자가 정답과 칸 하나하나까지 일치할 때만 그 과제를 푼 것으로 셉니다. 최종 점수는 평가 세트 전체에서 푼 과제의 비율(퍼센트)입니다.
검증 방식
채점은 자동이고 정확합니다. 제출한 출력 격자를 정답 격자와 칸 단위로 비교하며, 부분 점수도 사람 투표도 없습니다.
왜 중요한가
이 퍼즐들은 사람에게는 쉽지만 암기한 패턴에 의존하는 모델에게는 어렵도록 설계되어, 지식 암기가 아니라 진짜 추상화와 소수 예시 일반화를 시험합니다 — 그래서 더 범용적인 AI로 나아가는 진전을 재는 척도로 주목받습니다.
예제 풀이
문제
ARC-AGI 1은 입력→출력 그리드 예시 몇 개를 보여준 뒤 숨겨진 테스트 입력을 준다. 변환 규칙을 추론해 정확한 출력 그리드를 그려야 한다(칸은 색 0-9, 0=검정). 예시는 자기 프랙탈 규칙을 드러낸다: 각 3×3 그리드는 9×9로 확장되어, 칸에 색이 있으면 전체 그리드의 복사본을, 0이면 빈 3×3 블록을 찍는다. 테스트 입력(3×3): 0 8 0 / 8 8 8 / 0 8 0 (색 8의 플러스 모양).
해답
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
풀이
색 8 칸은 플러스의 네 변 중점과 중심에 있으며, 플러스를 바로 이 다섯 개의 3×3 블록에 찍고(네 모서리는 비움) 9×9 프랙탈을 만든다. ARC-AGI는 칸 단위 완전 일치만 채점하며, 한 칸이라도 틀리면 실패하고 시도는 최대 2회까지 허용된다.
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
타임라인
날짜 모델 점수 출처
2026-04-16 o3 75.0% GPT-5.2, 2025년 12월 ARC-AGI-2 벤치마크에서 약 53% 달성
2026-03-09 Opus 4.6 93.0% ARC-AGI 벤치마크에서 성능 2~3배 저하, 비용은 390배 감소
2025-12-11 GPT-5.2 Pro 90.5% OpenAI, GPT-5.2 출시, 코딩 및 추론 벤치마크에서 Gemini 3 압도
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI, 코드 작성·긴 문맥·추론 능력 개선된 GPT-5.2 출시
2025-12-05 Tiny Recursive Model (TRM) 45.0% ARC Prize 2025 결과, AGI 진보의 핵심으로 정제 루프 부각
2025-12-05 CompressARC 20.0% ARC Prize 2025 결과, AGI 진보의 핵심으로 정제 루프 부각
2025-10-06 TRM 45.0% Tiny Recursive Model (TRM)이 700만 매개변수로 LLM보다 높은 ARC-AGI 정확도 달성
2025-09-16 Grok-4 79.6% Grok-4를 사용한 영어 지시사항 진화로 ARC-AGI v2 SoTA 달성
2025-08-15 HRM 32.0% HRM의 ARC-AGI 성능은 외부 루프 정제와 암기에 의해 주도된다는 분석
2025-04-22 o3-preview-low 76.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o4-mini-medium 41.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o4-mini-low 21.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o3-medium 53.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o3-low 41.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o3-preview-high 88.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-20 o3-preview (low) 75.7% OpenAI의 o3, FrontierMath에서 초기 주장보다 낮은 점수 기록
2025-04-20 o3-preview (high) 87.5% OpenAI의 o3, FrontierMath에서 초기 주장보다 낮은 점수 기록
2024-12-20 o3 tuned low 76.0% OpenAI, ARC AGI 및 Frontier Math 돌파구와 함께 o3 추론 모델 미리보기
2024-12-20 o3 75.7% OpenAI o3, ARC-AGI-Pub에서 파격적인 점수 달성
2024-12-20 o3 75.7% OpenAI, 추론 및 코딩에서 높은 성능을 갖춘 o3 모델 출시
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% 제레미 버먼 및 MIT/코넬 팀, ARC-AGI-Pub에서 새로운 최첨도 달성
2024-12-18 Claude Sonnet 3.5 53.6% 제레미 버먼 및 MIT/코넬 팀, ARC-AGI-Pub에서 새로운 최첨도 달성
2024-12-06 MindsAI 55.5% ARC Prize 2024 우승자 발표; ARC-AGI-1의 SOTA가 55.5%로 상승
2024-12-06 Sonnet 3.5.1 53.6% 제레미 버먼, 진화적 테스트 시간 컴퓨팅을 활용한 Sonnet 3.5로 ARC-AGI-Pub에서 53.6% 달성
2024-06-17 GPT-4o 50.0% GPT-4o, 대량 샘플링을 통해 ARC-AGI에서 SoTA 50% 달성