L'auteur a obtenu une nouvelle précision de pointe de 50 % sur l'ensemble de test public du benchmark de raisonnement ARC-AGI, en exploitant GPT-4o pour générer et évaluer des milliers d'implémentations Python par problème.

  • La méthode génère environ 8 000 programmes Python par problème en utilisant des prompts few-shot avec un raisonnement étape par étape.
  • Les programmes sont sélectionnés en fonction de leur correction par rapport aux exemples fournis, avec une approche d'ensemble pour les variations de taille de grille.
  • Une phase de révision tente de corriger les 12 implémentations les plus prometteuses en leur montrant leur sortie réelle et en demandant des corrections.
  • L'état de l'art précédent était de 34 % de précision, tandis que les humains atteignent 85 % sur la distribution d'entraînement plus facile.

Ce résultat démontre que les grands modèles de langage actuels peuvent performer decently well (de manière assez bonne) sur des tâches de raisonnement complexes grâce à un échantillonnage extensif et une vérification, remettant en question les affirmations selon lesquelles ils manquent de capacités d'apprentissage lors de l'inférence.