VHD-Playは、数学的モデルのサンプリングと求解を経て、その意思決定プロセスを状態保持ツールとしてレンダリングすることで、多様な自律型強化学習環境を生成するパイプラインである。このアプローチにより、実行可能なダイナミクスや軌道スコアリングの参照が解決済みモデルから直接継承され、既存のパイプラインで一般的にみられる不整合の問題に対処する。

  • パイプラインは各環境のコストを数セントで抑えつつ、3,300の多様な自律型環境を生成する。
  • 3つのファミリーでQwen3.6-35B-A3Bを訓練すると、5ファミリーの診断において平均自律型スコアが0.204から0.815に向上する。
  • 性能向上は保持されたインスタンス、8つの未見のメカニズムファミリー、および汎用関数呼び出し、旅行計画、eコマースに関する外部ベンチマークにも及ぶ。
  • 手書きの問題と状態保持版を比較すると、学習可能なギャップは基礎的な問題解決ではなく、主に状態保持インタラクションに起因することが示された。

著者らはこれを重要視している。なぜなら、凍結された35Bのセットターがより大規模な環境を実現可能であり、メカニズムのサイズとホライズンが増大してもスケーリングマッチした訓練で性能向上が維持されることから、進化しうる訓練基盤の可能性を示唆しているからである。