Автор достиг нового рекордного результата точности в 50% на публичном тестовом наборе данных для бенчмарка логического вывода ARC-AGI, используя GPT-4o для генерации и оценки тысяч реализаций на Python для каждой задачи.

  • Метод генерирует примерно 8 000 программ на Python для каждой задачи с использованием few-shot промптов с пошаговым рассуждением.
  • Программы отбираются на основе их правильности по отношению к предоставленным примерам, с применением ансамблевого подхода для вариаций размера сетки.
  • Фаза пересмотра пытается исправить 12 наиболее перспективных реализаций, показывая им их фактический вывод и запрашивая исправления.
  • Предыдущий рекорд составлял 34% точности, в то время как люди достигают 85% на более лёгком обучающем распределении.

Этот результат демонстрирует, что современные большие языковые модели могут достаточно хорошо справляться со сложными задачами логического вывода благодаря обширному сэмплированию и проверке, опровергая утверждения о том, что они не способны к обучению во время инференса.