저자는 ARC-AGI 추론 벤치마크의 공개 테스트 세트에서 50%의 새로운 최첨단 정확도를 달성했으며, 이는 각 문제에 대해 수천 개의 Python 구현을 생성하고 평가하기 위해 GPT-4o를 활용하여 이루어졌습니다.

  • 이 방법은 단계별 추론이 포함된 퓨샷 프롬프트를 사용하여 문제당 약 8,000개의 Python 프로그램을 생성합니다.
  • 프로그램은 제공된 예시에 대한 정확성에 따라 선택되며, 그리드 크기 변동을 위해 앙상블 접근 방식이 사용됩니다.
  • 수정 단계는 실제 출력을 보여주고 수정을 요청하여 가장 유망한 상위 12개 구현을 수정하려고 시도합니다.
  • 이전 최첨단 정확도는 34%였으며, 인간은 더 쉬운 훈련 분포에서 85%를 달성합니다.

이 결과는 현재 대규모 언어 모델이 광범위한 샘플링과 검증을 통해 복잡한 추론 작업에서 decently well(상당히 잘) 수행할 수 있음을 보여주며, 추론 시 학습 능력이 부족하다는 주장을 도전합니다.