벤치마크 · reasoning

ARC-AGI 3

12 결과 7 모델

ARC Prize's third generation (2026): the agent must learn an unseen interactive game environment from scratch. Scores run far lower than — and are NOT comparable to — the static grid-puzzle ARC-AGI 1/2.

0 25 50 75 100 2026-07-17 2026-08-12 2026-09-07 Schema · 99 · 2026-07-17 Claude Opus 5 · 30.2 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-08-13 Prime Agent · 95.5 · 2026-08-06 Prime Agent · 95.5 · 2026-08-25 Prime Agent · 95.5 · 2026-08-25 GPT-6 Astra · 99.9 · 2026-09-04 GPT-6 Astra · 62.7 · 2026-09-04 Nvidia AVO · 100 · 2026-09-04 GPT‑6 Astra · 99.9 · 2026-09-05 GPT‑6 Astra · 99.9 · 2026-09-07
Schema Claude Opus 5 GPT‑5.6 Sol Prime Agent GPT-6 Astra Nvidia AVO GPT‑6 Astra
타임라인
날짜 모델 점수 출처
2026-09-07 GPT‑6 Astra 99.9% 클로드가 페르마의 마지막 정리를 증명하고, 오픈AI는 자동화 연구원을 계획합니다
2026-09-05 GPT‑6 Astra 99.9% OpenAI, 향상된 컴퓨터 사용·코딩·사이버보안 기능을 갖춘 GPT-6 Astra 출시
2026-09-04 GPT-6 Astra 62.7% 엔비디아, 허깅페이스 인수; 오픈에이아이, GPT-6 Astra 출시; 마이크로소프트, MAI-Transcribe-2 출시
2026-09-04 Nvidia AVO 100.0% Nvidia, AVO 하네스를 사용하여 ARC AGI-3에서 100% 달성
2026-09-04 GPT-6 Astra 99.9% OpenAI가 105만 토큰 컨텍스트를 갖춘 컴퓨터 사용 모델 GPT-6 Astra 출시
2026-08-25 Prime Agent 95.5% Prime Agent: 자기 개선형 RLM 하네스가 ARC-AGI-3 RHAE Best@1을 95.5%로 끌어올림
2026-08-25 Prime Agent 95.5% Prime Agent: 자기 개선형 RLM 하네스가 ARC-AGI-3 RHAE Best@1을 95.5%로 상승
2026-08-13 GPT‑5.6 Sol 38.3% OpenAI, 저렴한 비용으로 고품질 에이전트 워크플로우를 위한 GPT-5.6 출시
2026-08-06 Prime Agent 95.5% PrimeIntellect가 자기 개선형 코딩 하네스인 Prime Agent를 출시
2026-07-31 GPT‑5.6 Sol 38.3% OpenAI, GPT-5.6 Luna 가격 80% 인하
2026-07-31 Claude Opus 5 30.2% Anthropic, Claude Opus 5 출시; OpenAI 모델이 보안 테스트 중 Hugging Face 침투
2026-07-17 Schema 99.0% Moonshot, Kimi K3 출시; Schema harness, ARC-AGI 3에서 99% 달성