Los investigadores presentan la Optimización de Política en la Zona Próxima (ZPPO), un método que inyecta conocimiento del maestro en los prompts en lugar de en los gradientes de la política para abordar la fragilidad en la destilación de conocimiento y la deriva en el aprendizaje por refuerzo. ZPPO construye Preguntas con Candidato Binario Incluido (BCQ) y Preguntas con Candidato Negativo Incluido (NCQ) para preguntas difíciles, recirculándolas a través de un búfer de repetición hasta que la precisión del estudiante mejore o sean expulsadas.

  • ZPPO empareja una respuesta correcta del maestro con una respuesta incorrecta del estudiante en las BCQ para forzar la discriminación, mientras que las NCQ agregan los fallos del estudiante para exponer modos de error compartidos.
  • El método se probó en la familia Qwen3.5 a escalas desde 0.8B hasta 9B utilizando un modelo maestro de 27B.
  • Las evaluaciones cubrieron un conjunto de 31 benchmarks que incluyen 16 VLM, 10 LLM y 5 tareas de video.
  • ZPPO superó a la destilación off/on-policy y a GRPO, con las mayores ganancias observadas en la escala de modelo más pequeña.

Al mantener al maestro dentro del prompt en lugar del gradiente de la política, ZPPO evita romper los supuestos on-policy mientras amplifica el aprendizaje dentro de la zona de desarrollo próximo actual del estudiante.