VHD-Play es una tubería que genera diversos entornos de aprendizaje por refuerzo agéntico muestreando y resolviendo modelos matemáticos antes de renderizar sus procesos de decisión como herramientas con estado. Este enfoque asegura que la dinámica ejecutable y las referencias de puntuación de trayectorias se hereden directamente del modelo resuelto, abordando los problemas de desalineación comunes en las tuberías de generación existentes.
- La tubería produce 3,300 entornos agénticos diversos con un costo de unos pocos centavos cada uno.
- El entrenamiento de Qwen3.6-35B-A3B en tres familias eleva su puntuación agéntica media de 0.204 a 0.815 en un diagnóstico de cinco familias.
- Las ganancias se extienden a instancias no vistas, ocho familias de mecanismos desconocidos y benchmarks externos para llamada de funciones general, planificación de viajes y comercio electrónico.
- Las comparaciones entre problemas escritos y versiones con estado muestran que la brecha aprendible radica principalmente en la interacción con estado más que en la resolución subyacente del problema.
Los autores consideran esto significativo porque un fijador de 35B puede realizar entornos más grandes, y el entrenamiento a escala coincidente conserva las ganancias a medida que crecen el tamaño del mecanismo y el horizonte, lo que indica el potencial para un sustrato de entrenamiento en evolución.