Los investigadores introducen Relay On-Policy Distillation (Relay-OPD) para abordar el fallo de prefijo en la destilación on-policy estándar, donde los errores del estudiante conducen a una supervisión poco fiable. El método utiliza una asimetría de continuación maestro-estudiante como disparador para que el maestro tome brevemente el control y redirija la trayectoria antes de que el estudiante retome.
- Utiliza un maestro Qwen3-4B-Instruct-2507 con estudiantes Qwen3-0.6B/1.7B-Non-Thinking en ocho benchmarks de razonamiento matemático.
- Logra los mejores o segundos mejores resultados en cada benchmark, superando a OPD estándar en +5.73% y FastOPD en +1.49% en promedio para el modelo de 1.7B.
- Se observan ganancias consistentes a la escala de 0.6B, mientras que la longitud de la trayectoria de entrenamiento se reduce en más del 50%.
Este enfoque concentra la intervención en posiciones críticas iniciales mediante un presupuesto de relevo limitado, limitando la desviación de la política del estudiante mientras mejora significativamente la eficiencia y la precisión.