Jeremy Berman a établi un nouveau record public de 53,6 % de précision sur le classement ARC-AGI-Pub en appliquant un algorithme évolutionniste au modèle Sonnet 3.5 d'OpenAI, dépassant ainsi le score précédent de 43 %. L'approche traite le LLM comme un moteur d'évolution qui génère et affine des fonctions de transformation Python plutôt que des grilles de sortie directes.
La méthode implique la génération de vagues de fonctions Python candidates et leur évaluation par rapport aux exemples d'entraînement fournis à l'aide d'une évaluation de fitness en deux niveaux.
- Les fonctions les plus performantes sont sélectionnées comme parents pour créer des invites de révision pour les générations suivantes.
- Le processus itère à travers plusieurs générations, pouvant générer jusqu'à 500 fonctions par défi à l'aide de 31 invites dynamiques.
- Les solutions finales sont dérivées des deux meilleures fonctions sur toutes les générations, soumises sous forme de grilles de sortie candidates.
Berman suggère que la mise à l'échelle du calcul au moment du test guidée par des principes évolutionnistes permet aux LLM de compenser les limitations de généralisation et pourrait indiquer une voie vers l'Intelligence Générale Artificielle.