Автор достиг нового рекордного результата точности в 50% на публичном тестовом наборе данных для бенчмарка логического вывода ARC-AGI, используя GPT-4o для генерации и оценки тысяч реализаций на Python для каждой задачи.
- Метод генерирует примерно 8 000 программ на Python для каждой задачи с использованием few-shot промптов с пошаговым рассуждением.
- Программы отбираются на основе их правильности по отношению к предоставленным примерам, с применением ансамблевого подхода для вариаций размера сетки.
- Фаза пересмотра пытается исправить 12 наиболее перспективных реализаций, показывая им их фактический вывод и запрашивая исправления.
- Предыдущий рекорд составлял 34% точности, в то время как люди достигают 85% на более лёгком обучающем распределении.
Этот результат демонстрирует, что современные большие языковые модели могут достаточно хорошо справляться со сложными задачами логического вывода благодаря обширному сэмплированию и проверке, опровергая утверждения о том, что они не способны к обучению во время инференса.