Pesquisadores apresentam o PLVR (Program Learning with Verifiable Rewards), um método pós-treinamento que aprende programas de raciocínio explícitos compostos por primitivas determinísticas e neurais, em vez de atualizar os pesos do modelo. A abordagem utiliza retropropagação simbólica, onde a atribuição de crédito é realizada via inferência de tipos sobre as assinaturas das primitivas em vez de estimativa.
- No LiveCodeBench v6 e Tau2Bench, modelos base de 30B com PLVR superam o aprendizado por reforço em média em 27.8 pontos com orçamento equivalente.
- O método também supera modelos de fronteira uma ordem de magnitude maiores em 13.6 pontos.
- Uma única biblioteca de primitivas serve para ambos os benchmarks, exigindo apenas 100 exemplos para novas tarefas sem dados adicionais de ajuste fino.
- Experimentos identificam o passo reverso como a fonte da vantagem sobre a amostragem uniforme.
Os autores lançam uma biblioteca de retropropagação simbólica e um verificador de conformidade para permitir a aplicação a outras bibliotecas de primitivas.