Pesquisadores propõem o Masters, um framework de aprendizado por reforço progressivo com mascaramento para destilar modelos grandes de visão e linguagem em versões compactas adequadas para implantação em dispositivos de borda. O método aborda a instabilidade causada pela lacuna de tamanho entre os modelos professor e aluno.

  • O Masters mascara os pesos não dominantes do professor para reduzir a complexidade, depois restaura progressivamente a capacidade durante o treinamento para permitir um aprendizado mais suave.
  • Ele integra uma etapa de RL offline usando respostas pré-geradas de professores mascarados, evitando o custo computacional dos paradigmas de pensar-responder online.
  • O framework emprega duas recompensas complementares: uma recompensa de precisão para a correção da resposta e uma recompensa de destilação que quantifica a facilidade de transferência.

Esta abordagem permite que os alunos alcancem um desempenho sólido aproveitando uma orientação rica, porém eficiente, sem exigir processos longos de geração de respostas.