Исследователи представляют On-Policy Power Distillation (OPPD), метод, который обучает модели генерировать качественные ответы за один проход, имитируя усиленное распределение вероятностей учителя. Этот подход устраняет необходимость в обширном сэмплировании кандидатов во время вывода, значительно повышая производительность на математических и кодовых бенчмарках.

  • OPPD использует последовательный сэмплер Монте-Карло, где веса усиленного распределения замороженного учителя применяются к кандидатам, сгенерированным моделью-студентом, для обновлений максимального правдоподобия.
  • Метод увеличивает точность однократной генерации на 23,0 балла в MATH500 и на 27,3 балла в GSM8K по сравнению с необученным базовым уровнем при той же температуре.
  • Одна генерация от дистиллированной модели превосходит power sampling с 64 кандидатами, восстанавливая 94 процента улучшения, обеспечиваемого 16 кандидатами в необученной модели.
  • OPPD показывает более высокие результаты, чем GRPO, обученный с проверенными наградами, на MATH500, GSM8K и AIME без использования эталонных ответов, и может добавить до 9,3 балла при применении после GRPO.
  • Техника повышает точность HumanEval на 5,3 балла и сохраняет улучшения для различных семейств моделей и размеров.

Этот метод позволяет моделям достигать улучшений рассуждений, которые обычно требуют тяжелого сэмплирования или дополнительных эталонных данных, через прямые обновления параметров.