Бенчмарк · reasoning

ARC-AGI 2

33 результатов 28 моделей

ARC-AGI 2 (Abstraction & Reasoning Corpus, версия 2, проводится как ARC Prize 2025) измеряет гибкое мышление: способность вывести абстрактное правило из нескольких примеров и применить его к новому случаю. Оценка — это процент головоломок, решённых верно на закрытом, полу-приватном наборе для оценки.

Подробнее
Пример
В задаче даётся несколько пар «вход→выход» в виде цветных сеток (небольшая сетка цветных клеток, изменённая по одному согласованному правилу), и решающий должен понять скрытое преобразование и построить правильную выходную сетку для нового входа.
Метрика
Каждая головоломка оценивается по принципу «решено/не решено»: полученная выходная сетка сравнивается с точной правильной сеткой, а итоговая оценка — это процент решённых головоломок на полу-приватном наборе для оценки.
Приёмка
Результаты проверяются автоматически по точному совпадению выходной сетки — предсказанная сетка должна совпадать с ответом клетка в клетку — на полу-приватном тестовом наборе, который не публикуется, чтобы исключить заучивание.
Почему важно
Он сосредоточен на задачах, которые легки для людей, но трудны для AI, поэтому служит внимательно отслеживаемым показателем настоящей абстракции и общего рассуждения, а не заученных знаний.
Разбор примера
Задача
Головоломка-сетка ARC-AGI-2: определите преобразование по обучающим парам, затем укажите выходную сетку для тестового входа (цифры 0–9 — цвета, 0 = чёрный фон). Обучение 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]. Обучение 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]. Тест: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
Решение
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
Разбор
Каждая обучающая пара показывает одно правило — «гравитацию»: каждая цветная клетка падает вертикально вниз на самые нижние свободные клетки своего столбца, сохраняя цвет и количество, а фон (0) поднимается вверх. В тесте две 5 в столбце 0 и две 2 в столбце 2 оседают в двух нижних строках. ARC-AGI-2 оценивается по точному совпадению сетки — правильные размеры и значение каждой клетки — по схеме pass@2 (две попытки).
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
Хронология
Дата Модель Результат Источник
2026-08-03 Inkling-Small 40.1% Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов
2026-07-06 Gemini 3 Pro 54.0% Поиск, управляемый модальностью, с целостной оценкой трасс для ARC-AGI-2
2026-07-06 GPT-5.2 Pro 54.2% Поиск, управляемый модальностью, с целостной оценкой трасс для ARC-AGI-2
2026-04-25 GPT-5.5 85.0% OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2 достигает ~53% на ARC-AGI-2 в декабре 2025 года
2026-04-16 Confluence Lab 97.9% GPT-5.2 достигает ~53% на ARC-AGI-2 в декабре 2025 года
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2 достигает ~53% на ARC-AGI-2 в декабре 2025 года
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2 достигает ~53% на ARC-AGI-2 в декабре 2025 года
2026-04-16 GPT-5.2 53.0% GPT-5.2 достигает ~53% на ARC-AGI-2 в декабре 2025 года
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2 достигает ~53% на ARC-AGI-2 в декабре 2025 года
2026-02-19 Gemini 3.1 Pro 77.1% Google выпустила Gemini 3.1 Pro с улучшенным рассуждением
2026-02-12 Gemini 3 Deep Think 84.6% Google выпустила обновлённый Gemini 3 Deep Think с новыми результатами бенчмарков
2026-02-05 Claude Opus 4.6 68.8% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI представляет GPT-5.2 с улучшенными возможностями программирования, работы с длинным контекстом и рассуждений
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI выпустила GPT-5.2, превосходящую Gemini 3 в тестах по программированию и рассуждению
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% Результаты ARC Prize 2025 подчеркивают важность циклов уточнения для прогресса в области AGI
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% Исследователи NVIDIA выиграли Kaggle ARC Prize 2025 с экономичным рассуждением AGI
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq достигает 54% на ARC-AGI-2 при половине затрат благодаря мета-системе
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% Результаты ARC Prize 2025 подчеркивают важность циклов уточнения для прогресса в области AGI
2025-12-05 Tiny Recursive Model (TRM) 8.0% Результаты ARC Prize 2025 подчеркивают важность циклов уточнения для прогресса в области AGI
2025-11-18 Gemini 3 Deep Think 45.1% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-11-18 Gemini 3 Deep Think 45.1% Google выпустила Gemini 3 Pro с передовыми возможностями рассуждения и мультимодальности
2025-10-06 TRM 8.0% Малая рекурсивная модель (TRM) демонстрирует более высокую точность ARC-AGI по сравнению с LLM на 7 млн параметров
2025-09-16 Grok-4 29.4% ARC-AGI v2 SoTA установлен путем эволюции английских инструкций с Grok-4
2025-08-15 HRM 2.0% Анализ показывает, что производительность HRM на ARC-AGI обусловлена уточнением внешнего цикла и запоминанием
2025-08-08 Grok 4 15.9% xAI Grok 4 лидирует в бенчмарке Arc-AGI2 с результатом 15.9% против GPT5
2025-07-09 Grok 4 15.9% xAI выпустила Grok 4 с масштабированным обучением с подкреплением и нативным использованием инструментов
2025-04-22 o4-mini-medium 3.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o4-mini-low 3.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o3-medium 3.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-04-22 o3-low 3.0% ARC Prize Foundation оценивает OpenAI o3 и o4-mini на бенчмарках ARC-AGI
2025-03-24 public AI reasoning systems 9.0% Фонд ARC Prize запускает бенчмарк ARC-AGI-2 и приз ARC Prize 2025
2024-12-20 o3 tuned high 87.0% OpenAI демонстрирует модель рассуждений o3 с прорывами в ARC AGI и Frontier Math