Los investigadores presentan la Destilación de Potencia On-Policy (OPPD), un método que entrena modelos de lenguaje para generar respuestas de alta calidad en un solo pase imitando la distribución de probabilidad afilada de un modelo maestro. Este enfoque elimina la necesidad de un muestreo extensivo de candidatos durante la inferencia, mientras mejora significativamente el rendimiento en tareas de razonamiento.
- OPPD utiliza un muestreador de Monte Carlo secuencial donde las ponderaciones de la distribución de potencia de un maestro congelado se aplican a los candidatos generados por el modelo que se está entrenando.
- El método aumenta la precisión de la generación única hasta en 23,0 puntos en MATH500 y 27,3 en GSM8K en comparación con el modelo no entrenado a la misma temperatura.
- Una única generación del modelo destilado supera al muestreo de potencia publicado con 64 candidatos, recuperando el 94 por ciento de la ganancia proporcionada por 16 candidatos en el modelo no entrenado.
- OPPD obtiene puntuaciones más altas que GRPO en MATH500, GSM8K y AIME sin utilizar respuestas de referencia, y puede añadir hasta 9,3 puntos cuando se aplica después de GRPO.
- La técnica también eleva la precisión de HumanEval hasta en 5,3 puntos y funciona a través de diferentes familias y tamaños de modelos.
OPPD proporciona una manera eficiente en parámetros para mejorar las capacidades de razonamiento sin cambiar la arquitectura del modelo ni requerir inferencia basada en búsqueda.