U-OPSD permite auto-distilação on-policy não supervisionada para LLMs
Pesquisadores propõem Auto-Distilação On-Policy Não Supervisionada (U-OPSD), um método que alcança melhoria no pós-treinamento para grandes modelos de linguagem usando apenas as próprias gerações do modelo, sem supervisão externa. A abordagem amostra múltiplas execuções para construir uma pseudo-solução por meio de votação majoritária, em seguida, destila a distribuição do professor nos prefixos do maior completamento incorreto do modelo.