Исследователи представляют On-Policy Power Distillation (OPPD), метод, который обучает модели генерировать качественные ответы за один проход, имитируя усиленное распределение вероятностей учителя. Этот подход устраняет необходимость в обширном сэмплировании кандидатов во время вывода, значительно повышая производительность на математических и кодовых бенчмарках.
- OPPD использует последовательный сэмплер Монте-Карло, где веса усиленного распределения замороженного учителя применяются к кандидатам, сгенерированным моделью-студентом, для обновлений максимального правдоподобия.
- Метод увеличивает точность однократной генерации на 23,0 балла в MATH500 и на 27,3 балла в GSM8K по сравнению с необученным базовым уровнем при той же температуре.
- Одна генерация от дистиллированной модели превосходит power sampling с 64 кандидатами, восстанавливая 94 процента улучшения, обеспечиваемого 16 кандидатами в необученной модели.
- OPPD показывает более высокие результаты, чем GRPO, обученный с проверенными наградами, на MATH500, GSM8K и AIME без использования эталонных ответов, и может добавить до 9,3 балла при применении после GRPO.
- Техника повышает точность HumanEval на 5,3 балла и сохраняет улучшения для различных семейств моделей и размеров.
Этот метод позволяет моделям достигать улучшений рассуждений, которые обычно требуют тяжелого сэмплирования или дополнительных эталонных данных, через прямые обновления параметров.