VHD-Play — это конвейер, который генерирует разнообразные агентные среды обучения с подкреплением путём выборки и решения математических моделей, а затем преобразования их процессов принятия решений в инструменты с сохранением состояния. Этот подход гарантирует, что исполняемая динамика и эталоны оценки траекторий наследуются непосредственно из решённой модели, устраняя проблемы несогласованности, характерные для существующих конвейеров генерации.

  • Конвейер создаёт 3300 разнообразных агентных сред стоимостью в несколько центов за каждую.
  • Обучение Qwen3.6-35B-A3B на трёх семействах повышает средний агентный балл с 0,204 до 0,815 в диагностике по пяти семействам.
  • Улучшения распространяются на отложенные примеры, восемь невидимых семейств механизмов и внешние бенчмарки для общего вызова функций, планирования путешествий и электронной коммерции.
  • Сравнения между записанными задачами и версиями с сохранением состояния показывают, что обучаемый разрыв заключается преимущественно во взаимодействии с сохранением состояния, а не в решении базовой задачи.

Авторы считают это значимым, поскольку замороженная модель на 35B параметров может реализовывать более крупные среды, а обучение с сопоставимым масштабом сохраняет улучшения по мере роста размера механизма и горизонта планирования, что указывает на потенциал эволюционирующей обучающей основы.