Pesquisadores introduzem a Destilação de Poder On-Policy (OPPD), um método que treina modelos para gerar respostas de alta qualidade em uma única passagem, imitando a distribuição de probabilidade afinada de um modelo professor. Esta abordagem elimina a necessidade de amostragem extensiva de candidatos durante a inferência, enquanto aumenta significativamente o desempenho em benchmarks matemáticos e de codificação.

  • A OPPD utiliza um amostrador de Monte Carlo sequencial onde as pesos da distribuição de poder de um professor congelado ponderam os candidatos gerados pelo modelo estudante para atualizações de máxima verossimilhança.
  • O método aumenta a precisão de geração única em até 23,0 pontos no MATH500 e 27,3 pontos no GSM8K em comparação com a linha de base não treinada na mesma temperatura.
  • Uma única geração do modelo destilado supera o amostramento de poder com 64 candidatos, recuperando 94 por cento do ganho fornecido por 16 candidatos no modelo não treinado.
  • A OPPD obtém pontuação superior à GRPO treinada com recompensas verificadas no MATH500, GSM8K e AIME sem usar respostas de referência, e pode adicionar até 9,3 pontos quando aplicada após a GRPO.
  • A técnica aumenta a precisão do HumanEval em até 5,3 pontos e mantém os ganhos através de diferentes famílias e tamanhos de modelos.

Este método permite que os modelos alcancem melhorias no raciocínio que normalmente exigem amostragem pesada ou dados de referência adicionais por meio de atualizações diretas de parâmetros.