Бенчмарк · reasoning

ARC-AGI 1

28 результатов 26 моделей

ARC-AGI 1 измеряет способность к абстрактному рассуждению и обобщению: в каждой задаче даётся несколько примеров «вход→выход» в виде сеток, и решатель должен вывести скрытое правило преобразования и построить правильную выходную сетку для нового входа. Метрика — процент задач, решённых с точно совпавшей выходной сеткой.

Подробнее
Пример
Задача может показывать две-три небольшие цветные сетки, где каждый вход превращается в выход по одному и тому же правилу — например заливкой каждой замкнутой области или зеркальным отражением фигуры, — и это выведенное правило нужно применить к новой, ранее не виденной сетке.
Метрика
Задача считается решённой, только если построенная сетка совпадает с эталонным ответом клетка в клетку; итоговый результат — доля (процент) решённых задач по всему набору для оценки.
Приёмка
Проверка автоматическая и точная: присланная выходная сетка сравнивается с эталонной поклеточно, без частичного зачёта и без человеческого голосования.
Почему важно
Головоломки составлены так, чтобы быть лёгкими для людей, но трудными для моделей, опирающихся на запомненные шаблоны, поэтому бенчмарк проверяет настоящую абстракцию и обобщение по нескольким примерам, а не воспроизведение знаний, — и за ним пристально следят как за мерой прогресса к более общему ИИ.
Разбор примера
Задача
ARC-AGI 1 показывает несколько демонстраций «вход→выход» в виде сеток, затем — отложенный тестовый вход; нужно вывести правило и точно нарисовать выходную сетку (клетки — цвета 0-9, 0=чёрный). Здесь демонстрации раскрывают правило самофрактала: каждая сетка 3×3 расширяется до 9×9, вставляя копию всей сетки там, где клетка цветная, и пустой блок 3×3 там, где стоит 0. Тестовый вход (3×3): 0 8 0 / 8 8 8 / 0 8 0 (плюс цвета 8).
Решение
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
Разбор
Клетки цвета 8 расположены в серединах четырёх сторон и в центре плюса; вставка плюса ровно в эти пять блоков 3×3 (и пустые четыре угла) строит фрактал 9×9. ARC-AGI засчитывает только точное поклеточное совпадение сетки — одна неверная клетка проваливает задачу, допускается до 2 попыток.
0 24.5 49 73.5 98 2024-06-17 2025-06-21 2026-06-25 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Thinking · 86.2 · 2025-12-11 GPT-5.2 Pro · 90.5 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 iLLaDA-Base · 14.9 · 2026-06-25 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-low o3-medium o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Thinking GPT-5.2 Pro Opus 4.6 iLLaDA-Base OpenAI o3 (low compute) OpenAI o3 (high compute)
Хронология
Дата Модель Результат Источник
2026-06-25 iLLaDA-Base 14.9pts iLLaDA: 8-миллиардная языковая модель с маскированной диффузией и полностью двунаправленным вниманием
2026-04-16 o3 75.0% GPT-5.2 достигает ~53% на ARC-AGI-2 в декабре 2025 года
2026-03-09 Opus 4.6 93.0% Исследование выявило падение производительности в 2–3 раза на бенчмарках ARC-AGI при снижении стоимости в 390 раз
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI представляет GPT-5.2 с улучшенными возможностями программирования, работы с длинным контекстом и рассуждений
2025-12-11 GPT-5.2 Pro 90.5% OpenAI выпустила GPT-5.2, превосходящую Gemini 3 в тестах по программированию и рассуждению
2025-12-05 Tiny Recursive Model (TRM) 45.0% Результаты ARC Prize 2025 подчеркивают важность циклов уточнения для прогресса в области AGI
2025-12-05 CompressARC 20.0% Результаты ARC Prize 2025 подчеркивают важность циклов уточнения для прогресса в области AGI
2025-10-06 TRM 45.0% Малая рекурсивная модель (TRM) демонстрирует более высокую точность ARC-AGI по сравнению с LLM на 7 млн параметров
2025-09-16 Grok-4 79.6% ARC-AGI v2 SoTA установлен путем эволюции английских инструкций с Grok-4
2025-08-15 HRM 32.0% Анализ показывает, что производительность HRM на ARC-AGI обусловлена уточнением внешнего цикла и запоминанием
2025-04-22 o3-preview-low 76.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o4-mini-medium 41.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o4-mini-low 21.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o3-low 41.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o3-medium 53.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o3-preview-high 88.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-20 o3-preview (low) 75.7% Результаты OpenAI o3 на FrontierMath оказались ниже первоначально заявленных
2025-04-20 o3-preview (high) 87.5% Результаты OpenAI o3 на FrontierMath оказались ниже первоначально заявленных
2024-12-20 o3 tuned low 76.0% OpenAI демонстрирует модель рассуждений o3 с прорывами в ARC AGI и Frontier Math
2024-12-20 o3 75.7% OpenAI o3 достиг прорывных результатов на ARC-AGI-Pub
2024-12-20 o3 75.7% OpenAI выпустила модель o3 с высокой производительностью в рассуждениях и программировании
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% Джереми Берман и команда MIT/Cornell достигли нового рекорда на ARC-AGI-Pub
2024-12-18 Claude Sonnet 3.5 53.6% Джереми Берман и команда MIT/Cornell достигли нового рекорда на ARC-AGI-Pub
2024-12-06 MindsAI 55.5% Опубликованы победители ARC Prize 2024; SOTA на ARC-AGI-1 выросла до 55,5%
2024-12-06 Sonnet 3.5.1 53.6% Джереми Берман достиг 53,6% на ARC-AGI-Pub с помощью Sonnet 3.5 и эволюционных вычислений во время тестирования
2024-06-17 GPT-4o 50.0% GPT-4o достигает SoTA на уровне 50% на ARC-AGI за счёт массового сэмплирования