Pesquisadores introduzem a Otimização de Política na Zona Próxima (ZPPO), um método que injeta conhecimento do professor nos prompts, em vez dos gradientes da política, para lidar com a fragilidade na destilação de conhecimento e no desvio no aprendizado por reforço. A ZPPO constrói Perguntas com Candidato Binário Incluído (BCQ) e Perguntas com Candidato Negativo Incluído (NCQ) para perguntas difíceis, recirculando-as por meio de um buffer de replay até que a precisão do aluno melhore ou sejam removidas.

  • A ZPPO emparelha uma resposta correta do professor com uma resposta incorreta do aluno nos BCQs para forçar a discriminação, enquanto os NCQs agregam falhas do aluno para revelar modos de erro compartilhados.
  • O método foi testado na família Qwen3.5 nas escalas de 0,8B a 9B, usando um modelo professor de 27B.
  • As avaliações cobriram um conjunto de 31 benchmarks, incluindo 16 tarefas VLM, 10 LLM e 5 de vídeo.
  • A ZPPO superou a destilação off/on-policy e o GRPO, com os maiores ganhos observados na menor escala do modelo.

Ao manter o professor dentro do prompt em vez do gradiente da política, a ZPPO evita quebrar as suposições on-policy enquanto amplifica o aprendizado dentro da zona de desenvolvimento próximo atual do aluno.