O VHD-Play é um pipeline que gera ambientes diversos de aprendizado por reforço agêntico ao amostrar e resolver modelos matemáticos antes de renderizar seus processos de decisão como ferramentas com estado. Essa abordagem garante que dinâmicas executáveis e referências de pontuação de trajetória sejam herdadas diretamente do modelo resolvido, abordando os problemas de desalinhamento comuns em pipelines de geração existentes.

  • O pipeline produz 3.300 ambientes agênticos diversos a um custo de alguns centavos cada.
  • O treinamento do Qwen3.6-35B-A3B em três famílias eleva sua pontuação agêntica média de 0,204 para 0,815 em um diagnóstico com cinco famílias.
  • Os ganhos se estendem a instâncias não vistas, oito famílias de mecanismos desconhecidas e benchmarks externos para chamada de funções gerais, planejamento de viagens e comércio eletrônico.
  • Comparações entre problemas escritos e versões com estado mostram que a lacuna aprendível reside principalmente na interação com estado, e não na resolução subjacente do problema.

Os autores consideram isso significativo porque um setter congelado de 35B pode realizar ambientes maiores, e o treinamento com escala correspondente mantém os ganços à medida que o tamanho do mecanismo e o horizonte crescem, indicando o potencial para um substrato de treinamento em evolução.