Al final de la competencia del Premio ARC 2024, dos nuevas presentaciones verificadas alcanzaron puntuaciones de estado del arte en la tabla de clasificación pública de ARC-AGI (ARC-AGI-Pub). Jeremy Berman obtuvo un 53,6% utilizando un enfoque de cómputo durante el tiempo de prueba evolutivo con Claude Sonnet 3.5, mientras que un equipo combinado de MIT y Cornell alcanzó una precisión del 47,5% mediante entrenamiento durante el tiempo de prueba.
El método de Jeremy Berman genera y refina iterativamente funciones de transformación de Python para evitar máximos locales, produciendo hasta 500 funciones por tarea. La colaboración MIT/Cornell aprovecha técnicas complementarias de inducción y transducción, mejorando la precisión en un factor de 6 sobre los modelos base ajustados finamente en un modelo de lenguaje de 8B parámetros.
Estos resultados demuestran un progreso sustancial en la prueba de modelos de vanguardia contra el benchmark ARC-AGI utilizando restricciones de cómputo relajadas.