Los investigadores presentan PLVR (Program Learning with Verifiable Rewards), un método post-entrenamiento que aprende programas de razonamiento explícitos compuestos por primitivas deterministas y neuronales en lugar de actualizar los pesos del modelo. El enfoque utiliza propagación inversa simbólica, donde la asignación de crédito se realiza mediante inferencia de tipos sobre las firmas de las primitivas en lugar de estimación.

  • En LiveCodeBench v6 y Tau2Bench, los modelos base de 30B con PLVR superan al aprendizaje por refuerzo en 27.8 puntos en promedio con un presupuesto equivalente.
  • El método también supera a modelos de última generación una orden de magnitud más grandes en 13.6 puntos.
  • Una única biblioteca de primitivas sirve para ambos benchmarks, requiriendo solo 100 ejemplos para nuevas tareas sin datos adicionales de ajuste fino.
  • Los experimentos identifican el paso hacia atrás como la fuente de ventaja sobre el muestreo uniforme.

Los autores publican una biblioteca de propagación inversa simbólica y un verificador de conformidad para permitir su aplicación a otras bibliotecas de primitivas.