VHD-Play adalah sebuah pipeline yang menghasilkan beragam lingkungan pembelajaran penguatan (reinforcement learning) agentic dengan cara melakukan sampling dan pemecahan model matematika sebelum merender proses pengambilan keputusan mereka sebagai alat berstatus (stateful). Pendekatan ini memastikan bahwa dinamika yang dapat dieksekusi dan referensi skor lintasan diwarisi langsung dari model yang telah terpecahkan, sehingga mengatasi masalah ketidakselarasan yang umum terjadi pada pipeline generasi yang ada.

  • Pipeline ini menghasilkan 3.300 lingkungan agentic yang beragam dengan biaya beberapa sen per lingkungan.
  • Pelatihan Qwen3.6-35B-A3B pada tiga keluarga meningkatkan skor agentic rata-rata dari 0,204 menjadi 0,815 dalam diagnostik lima keluarga.
  • Peningkatan juga berlaku untuk instance yang dihold-out, delapan keluarga mekanisme yang belum terlihat, dan benchmark eksternal untuk pemanggilan fungsi umum, perencanaan perjalanan, dan e-commerce.
  • Perbandingan antara masalah yang ditulis secara eksplisit dengan versi stateful menunjukkan bahwa celah yang dapat dipelajari terutama terletak pada interaksi stateful daripada pemecahan masalah mendasarnya.

Para penulis menganggap hal ini signifikan karena setter beku 35B dapat mewujudkan lingkungan yang lebih besar, dan pelatihan yang sebanding dalam skala mempertahankan peningkatan tersebut seiring bertambahnya ukuran mekanisme dan horizon, mengindikasikan potensi substrat pelatihan yang terus berkembang.