No final da competição do Prêmio ARC de 2024, duas novas submissões verificadas alcançaram pontuações de estado da arte na Leaderboard Pública do ARC-AGI (ARC-AGI-Pub). Jeremy Berman marcou 53,6% usando uma abordagem de computação em tempo de teste evolutiva com Claude Sonnet 3.5, enquanto uma equipe combinada do MIT e Cornell alcançou 47,5% de precisão via treinamento em tempo de teste.
O método de Jeremy Berman gera e refina iterativamente funções de transformação Python para evitar máximos locais, produzindo até 500 funções por tarefa. A colaboração MIT/Cornell alavanca técnicas complementares de indução e transdução, melhorando a precisão em 6 vezes sobre os modelos base ajustados finamente em um modelo de linguagem de 8B parâmetros.
Esses resultados demonstram progresso substancial na teste de modelos de fronteira contra o benchmark ARC-AGI usando restrições de computação relaxadas.