Jeremy Berman estableció un nuevo récord público de 53,6 % de precisión en el ranking de ARC-AGI-Pub al aplicar un algoritmo evolutivo al modelo Sonnet 3.5 de OpenAI, superando la puntuación máxima anterior de 43 %. El enfoque trata al LLM como un motor de evolución que genera y refina funciones de transformación en Python en lugar de cuadrículas de salida directas.
El método implica generar oleadas de funciones candidatas en Python y evaluarlas contra los ejemplos de entrenamiento proporcionados utilizando una evaluación de aptitud en dos niveles.
- Las funciones con mejor rendimiento se seleccionan como padres para crear indicaciones de revisión para las generaciones subsiguientes.
- El proceso itera a través de múltiples generaciones, potencialmente generando hasta 500 funciones por desafío usando 31 indicaciones dinámicas.
- Las soluciones finales se derivan de las dos mejores funciones en todas las generaciones enviadas como cuadrículas de salida candidatas.
Berman sugiere que escalar el cómputo en tiempo de prueba guiado por principios evolutivos permite a los LLM compensar limitaciones de generalización y puede indicar un camino hacia la Inteligencia General Artificial.