El autor logró una nueva precisión de estado del arte del 50% en el conjunto de prueba público para el benchmark de razonamiento ARC-AGI, aprovechando GPT-4o para generar y evaluar miles de implementaciones en Python por problema.
- El método genera aproximadamente 8.000 programas de Python por problema utilizando prompts few-shot con razonamiento paso a paso.
- Los programas se seleccionan según su corrección frente a los ejemplos proporcionados, con un enfoque de conjunto para variaciones del tamaño de la cuadrícula.
- Una fase de revisión intenta corregir las 12 implementaciones más prometedoras mostrándoles su salida real y solicitando correcciones.
- El estado del arte anterior era una precisión del 34%, mientras que los humanos alcanzan el 85% en la distribución de entrenamiento más fácil.
Este resultado demuestra que los modelos de lenguaje grandes actuales pueden desempeñarse decentemente bien en tareas de razonamiento complejas mediante un muestreo extenso y verificación, desafiando las afirmaciones de que carecen de capacidades de aprendizaje durante la inferencia.