À la fin du concours ARC Prize 2024, deux nouvelles soumissions vérifiées ont atteint des scores de pointe sur le tableau des leaders public ARC-AGI (ARC-AGI-Pub). Jeremy Berman a obtenu 53,6 % en utilisant une approche de calcul au moment du test évolutive avec Claude Sonnet 3.5, tandis qu'une équipe combinée MIT et Cornell a atteint 47,5 % de précision via l'entraînement au moment du test.
La méthode de Jeremy Berman génère et affine itérativement des fonctions de transformation Python pour éviter les maxima locaux, produisant jusqu'à 500 fonctions par tâche. La collaboration MIT/Cornell exploite des techniques complémentaires d'induction et de transduction, améliorant la précision de 6 fois par rapport aux modèles de base finement ajustés sur un modèle de langage de 8 milliards de paramètres.
Ces résultats démontrent des progrès substantiels dans le test des modèles de pointe contre le benchmark ARC-AGI en utilisant des contraintes de calcul assouplies.