제레미 버먼은 OpenAI의 Sonnet 3.5 모델에 진화 알고리즘을 적용하여 ARC-AGI-Pub 리더보드에서 이전 최고 점수인 43%를 뛰어넘는 53.6%의 새로운 공개 기록을 세웠습니다. 이 접근 방식은 LLM을 직접 출력 그리드 대신 Python 변환 함수를 생성하고 정제하는 진화 엔진으로 취급합니다.
이 방법은 제공된 학습 예제를 대상으로 2단계 적합도 평가를 사용하여 후보 Python 함수의 파동을 생성하고 점수를 매기는 과정을 포함합니다.
- 가장 우수한 성능을 보인 함수가 부모로 선택되어 후속 세대를 위한 수정 프롬프트를 생성합니다.
- 이 과정은 여러 세대를 거쳐 반복되며, 최대 31개의 동적 프롬프트를 사용하여 각 과제당 최대 500개의 함수를 생성할 수 있습니다.
- 최종 솔루션은 모든 세대에 걸쳐 상위 두 함수에서 도출되어 후보 출력 그리드로 제출됩니다.
버먼은 진화 원칙에 의해 안내되는 테스트 시간 컴퓨팅의 확장이 LLM이 일반화 한계를 보완할 수 있게 하며, 이는 인공지능 일반성(AGI)으로 가는 길을 나타낼 수 있다고 제안합니다.