Los investigadores proponen Masters, un marco de aprendizaje por refuerzo progresivo con enmascaramiento para destilar modelos grandes de visión y lenguaje en versiones compactas adecuadas para implementación en dispositivos periféricos. El método aborda la inestabilidad causada por la brecha de tamaño entre los modelos maestro y estudiante.
- Masters enmascara los pesos no dominantes del maestro para reducir la complejidad, luego restaura progresivamente la capacidad durante el entrenamiento para permitir un aprendizaje más suave.
- Integra una etapa de RL fuera de línea utilizando respuestas pregeneradas de maestros enmascarados, evitando el costo computacional de los paradigmas de pensamiento-respuesta en línea.
- El marco emplea dos recompensas complementarias: una recompensa de precisión para la corrección de la respuesta y una recompensa de destilación que cuantifica la facilidad de transferencia.
Este enfoque permite a los estudiantes lograr un rendimiento sólido aprovechando una guía rica pero eficiente sin requerir procesos largos de generación de respuestas.