Pesquisadores propõem Auto-Distilação On-Policy Não Supervisionada (U-OPSD), um método que alcança melhoria no pós-treinamento para grandes modelos de linguagem usando apenas as próprias gerações do modelo, sem supervisão externa. A abordagem amostra múltiplas execuções para construir uma pseudo-solução por meio de votação majoritária, em seguida, destila a distribuição do professor nos prefixos do maior completamento incorreto do modelo.
- U-OPSD melhora os modelos base em 8,5% e 10,7% no Qwen3 sem modo de raciocínio nas escalas de 4B e 8B em benchmarks como AIME24, MATH500 e AMC23.
- Supera métodos supervisionados como OPSD em média 3,2% e 2,3% no modo sem raciocínio.
- No modo de raciocínio, U-OPSD iguala ou supera OPSD e GRPO, superando este último em até 1,1% na escala de 8B.
Este método demonstra que a auto-distilação genuína é possível por meio da consistência interna, oferecendo uma alternativa competitiva aos sinais de treinamento supervisionado.