Исследователи предлагают Relay On-Policy Distillation (Relay-OPD) для устранения проблемы отказа префикса в стандартной дистилляции с использованием он-политики, где ошибки студента приводят к ненадежной супервизии. Метод использует асимметрию продолжения между учителем и учеником как триггер для того, чтобы учитель на короткое время взял управление на себя и перенаправил траекторию, прежде чем ученик возобновит работу.

  • Использует учителя Qwen3-4B-Instruct-2507 с учениками Qwen3-0.6B/1.7B-Non-Thinking на восьми бенчмарках математического рассуждения.
  • Демонстрирует лучшие или вторые лучшие результаты на каждом бенчмарке, превосходя стандартную OPD в среднем на +5.73% и FastOPD на +1.49% для модели 1.7B.
  • Наблюдаются стабильные улучшения на масштабе 0.6B, при этом длина траектории обучения сокращается более чем на 50%.

Этот подход концентрирует вмешательство на критических начальных позициях с помощью ограниченного бюджета ретрансляции, минимизируя отклонение от политики студента и одновременно значительно повышая эффективность и точность.