2024년 ARC Prize 대회 종료 시점, 두 개의 새로운 검증된 제출물이 ARC-AGI Public Leaderboard (ARC-AGI-Pub)에서 최첨도 점수를 달성했습니다. 제레미 버먼은 Claude Sonnet 3.5를 사용한 진화적 테스트 시간 컴퓨팅 접근 방식으로 53.6%의 점수를 얻었고, MIT와 코넬 대학의 합동 팀은 테스트 시간 학습을 통해 47.5%의 정확도에 도달했습니다.

제레미 버먼의 방법은 지역 최적점을 피하기 위해 Python 변환 함수를 반복적으로 생성하고 정제하여 작업당 최대 500개의 함수를 생성합니다. MIT/코넬 협력은 보완적인 유도 및 전도 기술을 활용하여 8B 파라미터 언어 모델에서 기본 파인튜닝된 모델 대비 정확도를 6배 향상시켰습니다.

이 결과들은 완화된 컴퓨팅 제약 조건을 사용하여 ARC-AGI 벤치마크에 대한 프론티어 모델을 테스트하는 데 상당한 진전을 보여주었습니다.