Les chercheurs présentent PLVR (Program Learning with Verifiable Rewards), une méthode post-entraînement qui apprend des programmes de raisonnement explicites composés de primitives déterministes et neuronales, au lieu de mettre à jour les poids du modèle. L'approche utilise la rétropropagation symbolique, où l'attribution de crédit est effectuée via une inférence de types sur les signatures des primitives plutôt que par estimation.

  • Sur LiveCodeBench v6 et Tau2Bench, les modèles de base de 30B avec PLVR surpassent l'apprentissage par renforcement en moyenne de 27.8 points à budget équivalent.
  • La méthode surpasse également des modèles de pointe un ordre de grandeur plus grands de 13.6 points.
  • Une seule bibliothèque de primitives sert les deux benchmarks, nécessitant seulement 100 exemples pour de nouvelles tâches sans données supplémentaires de fine-tuning.
  • Les expériences identifient le passage arrière comme la source de l'avantage par rapport à l'échantillonnage uniforme.

Les auteurs publient une bibliothèque de rétropropagation symbolique et un vérificateur de conformité pour permettre l'application à d'autres bibliothèques de primitives.