Los investigadores proponen la Auto-Distilación No Supervisada en Política (U-OPSD), un método que logra una mejora post-entrenamiento para modelos de lenguaje grandes utilizando únicamente las propias generaciones del modelo sin supervisión externa. El enfoque muestrea múltiples trayectorias para construir una pseudo-solución mediante votación mayoritaria, luego destila una distribución docente en los prefijos de la finalización incorrecta más larga del modelo.

  • U-OPSD mejora los modelos base en un 8,5% y 10,7% en Qwen3 sin modo de pensamiento a escalas de 4B y 8B en benchmarks como AIME24, MATH500 y AMC23.
  • Supera a métodos supervisados como OPSD por un promedio de 3,2% y 2,3% en modo sin pensamiento.
  • En modo de pensamiento, U-OPSD iguala o supera a OPSD y GRPO, superando a este último hasta un 1,1% a la escala de 8B.

Este método demuestra que la auto-distilación genuina es posible mediante la consistencia interna, ofreciendo una alternativa competitiva a las señales de entrenamiento supervisado.