VHD-Play est un pipeline qui génère des environnements d'apprentissage par renforcement agents diversifiés en échantillonnant et résolvant des modèles mathématiques avant de rendre leurs processus décisionnels sous forme d'outils avec état. Cette approche garantit que les dynamiques exécutables et les références de score de trajectoire sont héritées directement du modèle résolu, adressant les problèmes de désalignement courants dans les pipelines de génération existants.

  • Le pipeline produit 3 300 environnements agents diversifiés à un coût de quelques centimes chacun.
  • L'entraînement de Qwen3.6-35B-A3B sur trois familles élève son score agent moyen de 0,204 à 0,815 dans un diagnostic à cinq familles.
  • Les gains s'étendent aux instances hors jeu, huit familles de mécanismes invisibles et benchmarks externes pour l'appel de fonctions général, la planification de voyages et le e-commerce.
  • Les comparaisons entre problèmes écrits et versions avec état montrent que l'écart apprenable réside principalement dans l'interaction avec état plutôt que dans la résolution sous-jacente du problème.

Les auteurs considèrent cela significatif car un setter gelé 35B peut réaliser des environnements plus grands, et l'entraînement à échelle correspondante conserve les gains lorsque la taille du mécanisme et l'horizon croissent, indiquant le potentiel d'un substrat d'entraînement évolutif.