Исследователи представляют On-Policy Power Distillation (OPPD), метод, который обучает языковые модели генерировать высококачественные ответы за один проход, имитируя усиленное распределение вероятностей модели-учителя. Этот подход устраняет необходимость в обширном сэмплировании кандидатов во время вывода, одновременно значительно повышая производительность на задачах рассуждения.

  • OPPD использует последовательный сэмплер Монте-Карло, где силовое распрежение замороженной модели-учителя взвешивает кандидатов, сгенерированных обучаемой моделью.
  • Метод увеличивает точность однократной генерации на 23,0 балла в MATH500 и на 27,3 в GSM8K по сравнению с необученной моделью при той же температуре.
  • Одна генерация от дистиллированной модели превосходит опубликованный силовой сэмплинг с 64 кандидатами, восстанавливая 94 процента выигрыша, обеспечиваемого 16 кандидатами в необученной модели.
  • OPPD показывает более высокие результаты, чем GRPO, на MATH500, GSM8K и AIME без использования эталонных ответов, и может добавить до 9,3 балла при применении после GRPO.
  • Техника также повышает точность HumanEval на 5,3 балла и работает с различными семействами моделей и размерами.

OPPD обеспечивает параметрически эффективный способ улучшения способностей к рассуждению без изменения архитектуры модели или необходимости в выводе на основе поиска.