В конце конкурса ARC Prize 2024 года две новые проверенные работы достигли лучших результатов на публичной доске лидеров ARC-AGI (ARC-AGI-Pub). Джереми Берман набрал 53,6%, используя эволюционный подход к вычислениям во время тестирования с Claude Sonnet 3.5, в то время как объединенная команда MIT и Cornell достигла точности 47,5% благодаря обучению во время тестирования.

Метод Джереми Бермана итеративно генерирует и уточняет функции преобразования Python, чтобы избежать локальных максимумов, создавая до 500 функций на задачу. Сотрудничество MIT/Cornell использует дополнительные методы индукции и транздукции, улучшая точность в 6 раз по сравнению с базовыми моделями, дообученными на языковой модели с 8 миллиардами параметров.

Эти результаты демонстрируют значительный прогресс в тестировании передовых моделей против бенчмарка ARC-AGI при использовании ослабленных ограничений на вычисления.