Pesquisadores introduzem a Destilação On-Policy com Relay (Relay-OPD) para abordar a falha de prefixo na destilação on-policy padrão, onde os erros do estudante levam a uma supervisão não confiável. O método utiliza uma assimetria de continuação entre professor e estudante como gatilho para que o professor assuma brevemente o controle e redirecione a trajetória antes que o estudante retome.
- Utiliza um professor Qwen3-4B-Instruct-2507 com estudantes Qwen3-0.6B/1.7B-Non-Thinking em oito benchmarks de raciocínio matemático.
- Alcança os melhores ou segundos melhores resultados em todos os benchmarks, superando a OPD padrão em +5,73% e o FastOPD em +1,49% em média para o modelo de 1,7B.
- Ganhos consistentes são observados na escala de 0,6B, enquanto o comprimento da trajetória de treinamento é reduzido em mais de 50%.
Esta abordagem concentra a intervenção nas posições iniciais críticas por meio de um orçamento limitado de relay, limitando o desvio da política do estudante enquanto melhora significativamente a eficiência e a precisão.