Los investigadores presentan la Destilación de Potencia On-Policy (OPPD), un método que entrena a los modelos para generar respuestas de alta calidad en un solo pase imitando la distribución de probabilidad afilada de un modelo maestro. Este enfoque elimina la necesidad de un muestreo extenso de candidatos durante la inferencia, mientras aumenta significativamente el rendimiento en benchmarks matemáticos y de codificación.

  • OPPD utiliza un muestreador de Monte Carlo secuencial donde las ponderaciones de la distribución de potencia de un maestro congelado seleccionan los candidatos generados por el modelo estudiante para actualizaciones de máxima verosimilitud.
  • El método aumenta la precisión de la generación única hasta en 23.0 puntos en MATH500 y 27.3 puntos en GSM8K en comparación con la línea base no entrenada a la misma temperatura.
  • Una sola generación del modelo destilado supera al muestreo de potencia con 64 candidatos, recuperando el 94 por ciento de la ganancia proporcionada por 16 candidatos en el modelo no entrenado.
  • OPPD obtiene puntuaciones más altas que GRPO entrenado con recompensas verificadas en MATH500, GSM8K y AIME sin utilizar respuestas de referencia, y puede añadir hasta 9.3 puntos cuando se aplica después de GRPO.
  • La técnica eleva la precisión de HumanEval hasta en 5.3 puntos y mantiene las ganancias a través de diferentes familias y tamaños de modelos.

Este método permite a los modelos lograr mejoras de razonamiento que normalmente requieren un muestreo intensivo o datos de referencia adicionales, mediante actualizaciones directas de parámetros.