벤치마크 · reasoning

ARC-AGI 2

33 결과 28 모델

ARC-AGI 2(Abstraction & Reasoning Corpus 2판, ARC Prize 2025로 진행)는 유동적 추론을 측정합니다. 즉 몇 개의 예시만으로 추상적인 규칙을 추론해 새로운 경우에 적용하는 능력입니다. 점수는 공개하지 않는 준(準)비공개 평가 세트에서 올바르게 푼 퍼즐의 비율입니다.

자세히 보기
예시
한 문제에서는 색깔 grid의 입력→출력 쌍 몇 개가 주어지고(색칠된 칸으로 된 작은 grid가 일관된 방식으로 변형된 것), 푸는 사람은 숨겨진 변환 규칙을 알아내 새로운 입력에 대한 올바른 출력 grid를 만들어야 합니다.
채점 방식
각 퍼즐은 통과/실패로 채점됩니다. 생성한 출력 grid를 정확한 정답 grid와 비교하며, 보고되는 점수는 준비공개 평가 세트에서 푼 퍼즐의 비율입니다.
검증 방식
결과는 출력 grid의 정확 일치로 자동 검증되며(예측한 grid가 정답과 칸 단위로 일치해야 함), 암기를 막기 위해 공개하지 않는 준비공개 테스트 세트에서 평가됩니다.
왜 중요한가
사람에게는 쉽지만 AI에게는 어려운 퍼즐에 초점을 맞추기 때문에, 암기된 지식이 아니라 진정한 추상화와 일반 추론 능력을 재는 주목받는 지표입니다.
예제 풀이
문제
ARC-AGI-2 그리드 퍼즐: 학습 쌍에서 변환 규칙을 추론한 뒤, 테스트 입력에 대한 출력 그리드를 제시하세요 (숫자 0–9는 색상, 0 = 검은 배경). 학습 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]. 학습 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]. 테스트: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
해답
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
풀이
모든 학습 쌍이 하나의 규칙, 즉 '중력'을 보여준다: 각 색칠된 칸은 자기 열에서 곧장 아래로 떨어져 가장 아래의 빈 칸에 쌓이며 색과 개수는 유지되고 배경(0)은 위로 올라간다. 테스트에서는 0열의 5 두 개와 2열의 2 두 개가 맨 아래 두 행에 자리 잡는다. ARC-AGI-2는 그리드 완전 일치로 채점하며 — 올바른 크기와 모든 칸의 값 — 두 번의 시도를 허용하는 pass@2로 점수를 매긴다.
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
타임라인
날짜 모델 점수 출처
2026-08-03 Inkling-Small 40.1% Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
2026-07-06 Gemini 3 Pro 54.0% ARC-AGI-2를 위한 모달리티 기반 검색과 전체적 트레이스 판정
2026-07-06 GPT-5.2 Pro 54.2% ARC-AGI-2를 위한 모달리티 기반 검색과 전체적 트레이스 판정
2026-04-25 GPT-5.5 85.0% OpenAI, 네이티브 오미모달 처리를 갖춘 GPT-5.5 출시
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2, 2025년 12월 ARC-AGI-2 벤치마크에서 약 53% 달성
2026-04-16 Confluence Lab 97.9% GPT-5.2, 2025년 12월 ARC-AGI-2 벤치마크에서 약 53% 달성
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2, 2025년 12월 ARC-AGI-2 벤치마크에서 약 53% 달성
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2, 2025년 12월 ARC-AGI-2 벤치마크에서 약 53% 달성
2026-04-16 GPT-5.2 53.0% GPT-5.2, 2025년 12월 ARC-AGI-2 벤치마크에서 약 53% 달성
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2, 2025년 12월 ARC-AGI-2 벤치마크에서 약 53% 달성
2026-02-19 Gemini 3.1 Pro 77.1% 구글, 추론 능력 강화된 Gemini 3.1 Pro 출시
2026-02-12 Gemini 3 Deep Think 84.6% 구글, 새로운 벤치마크 점수를 갖춘 Gemini 3 Deep Think 출시
2026-02-05 Claude Opus 4.6 68.8% Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI, 코드 작성·긴 문맥·추론 능력 개선된 GPT-5.2 출시
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI, GPT-5.2 출시, 코딩 및 추론 벤치마크에서 Gemini 3 압도
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% ARC Prize 2025 결과, AGI 진보의 핵심으로 정제 루프 부각
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% NVIDIA 연구원들이 비용 효율적인 AGI 추론으로 Kaggle ARC Prize 2025 수상
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq, 메타 시스템으로 반값에 ARC-AGI-2에서 54% 달성
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% ARC Prize 2025 결과, AGI 진보의 핵심으로 정제 루프 부각
2025-12-05 Tiny Recursive Model (TRM) 8.0% ARC Prize 2025 결과, AGI 진보의 핵심으로 정제 루프 부각
2025-11-18 Gemini 3 Deep Think 45.1% 구글, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-11-18 Gemini 3 Deep Think 45.1% Google, 최첨단 추론 및 멀티모달 기능을 갖춘 Gemini 3 Pro 출시
2025-10-06 TRM 8.0% Tiny Recursive Model (TRM)이 700만 매개변수로 LLM보다 높은 ARC-AGI 정확도 달성
2025-09-16 Grok-4 29.4% Grok-4를 사용한 영어 지시사항 진화로 ARC-AGI v2 SoTA 달성
2025-08-15 HRM 2.0% HRM의 ARC-AGI 성능은 외부 루프 정제와 암기에 의해 주도된다는 분석
2025-08-08 Grok 4 15.9% xAI Grok 4, Arc-AGI2 벤치마크에서 GPT5 대비 15.9% 점수로 선두
2025-07-09 Grok 4 15.9% xAI가 확장된 강화 학습과 네이티브 도구 사용을 갖춘 Grok 4를 출시하다
2025-04-22 o4-mini-medium 3.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o4-mini-low 3.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o3-medium 3.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-04-22 o3-low 3.0% ARC Prize Foundation이 ARC-AGI 벤치마크에서 OpenAI o3 및 o4-mini를 평가
2025-03-24 public AI reasoning systems 9.0% ARC Prize Foundation이 ARC-AGI-2 벤치마크와 ARC Prize 2025를 출시
2024-12-20 o3 tuned high 87.0% OpenAI, ARC AGI 및 Frontier Math 돌파구와 함께 o3 추론 모델 미리보기