El autor logró una nueva precisión de estado del arte del 50% en el conjunto de prueba público para el benchmark de razonamiento ARC-AGI, aprovechando GPT-4o para generar y evaluar miles de implementaciones en Python por problema.

  • El método genera aproximadamente 8.000 programas de Python por problema utilizando prompts few-shot con razonamiento paso a paso.
  • Los programas se seleccionan según su corrección frente a los ejemplos proporcionados, con un enfoque de conjunto para variaciones del tamaño de la cuadrícula.
  • Una fase de revisión intenta corregir las 12 implementaciones más prometedoras mostrándoles su salida real y solicitando correcciones.
  • El estado del arte anterior era una precisión del 34%, mientras que los humanos alcanzan el 85% en la distribución de entrenamiento más fácil.

Este resultado demuestra que los modelos de lenguaje grandes actuales pueden desempeñarse decentemente bien en tareas de razonamiento complejas mediante un muestreo extenso y verificación, desafiando las afirmaciones de que carecen de capacidades de aprendizaje durante la inferencia.