VHD-Play는 수학적 모델을 샘플링하고 해결한 후 의사결정 과정을 상태 유지 도구로 렌더링하여 다양한 에이전트형 강화학습 환경을 생성하는 파이프라인입니다. 이 접근 방식은 실행 가능한 동역학과 궤적 평가 기준이 해결된 모델에서 직접 상속되도록 하여 기존 생성 파이프라인에서 흔히 발생하는 정렬 문제를 해결합니다.

  • 이 파이프라인은 각 환경당 몇 센트의 비용으로 3,300개의 다양한 에이전트 환경을 생성합니다.
  • 세 가지 계열에 대해 Qwen3.6-35B-A3B를 학습시키면 5개 계열 진단에서 평균 에이전트 점수가 0.204에서 0.815로 상승합니다.
  • 이 향상은 홀드아웃 인스턴스, 8개의 미시도 메커니즘 계열, 일반 함수 호출, 여행 계획, 전자상거래를 위한 외부 벤치마크 전반에 걸쳐 확장됩니다.
  • 서면 문제와 상태 유지 버전 간 비교는 학습 가능한 격차가 근본적인 문제 해결보다는 상태 유지 상호작용에 주로 있음을 보여줍니다.

저자들은 이는 고정된 35B 설정자가 더 큰 환경을 구현할 수 있고, 규모가 일치하는 학습이 메커니즘 크기와 시간 범위가 증가함에 따라 향상 효과를 유지하므로 진화하는 학습 기질의 잠재력을 시사하기 때문에 중요하다고 간주합니다.