Pesquisadores introduzem a Destilação de Poder On-Policy (OPPD), um método que treina modelos de linguagem para gerar respostas de alta qualidade em uma única passagem, imitando a distribuição de probabilidade afiada de um modelo professor. Essa abordagem elimina a necessidade de amostragem extensiva de candidatos durante a inferência, ao mesmo tempo em que impulsiona significativamente o desempenho em tarefas de raciocínio.

  • A OPPD utiliza um amostrador de Monte Carlo sequencial onde as distribuições de poder de um professor congelado ponderam os candidatos gerados pelo modelo que está sendo treinado.
  • O método aumenta a precisão da geração única em até 23,0 pontos no MATH500 e 27,3 no GSM8K em comparação com o modelo não treinado na mesma temperatura.
  • Uma única geração do modelo destilado supera a amostragem de poder publicada com 64 candidatos, recuperando 94 por cento do ganho fornecido por 16 candidatos no modelo não treinado.
  • A OPPD obtém pontuação superior à GRPO no MATH500, GSM8K e AIME sem usar respostas de referência, podendo adicionar até 9,3 pontos quando aplicada após a GRPO.
  • A técnica também eleva a precisão do HumanEval em até 5,3 pontos e funciona em diferentes famílias e tamanhos de modelos.

A OPPD oferece uma maneira eficiente em parâmetros para melhorar as capacidades de raciocínio sem alterar a arquitetura do modelo ou exigir inferência baseada em busca.