EnvRL представляет рамку, которая улучшает агентное обучение с помощью вознаграждения за интеграцию динамики среды через прогнозирование состояния и обратные динамические цели. При обучении с использованием GRPO, EnvRL повышает показатели успеха Qwen-2.5-1.5B-Instruct с 72,8% до 77,4% на ALFWorld и с 56,8% до 67,0% на WebShop.
EnvRL: Использование динамики среды в агентном RL
EnvRL: Использование динамики среды в агентном обучении с помощью вознаграждений
EnvRL представляет рамку, которая улучшает агентное обучение с вознаграждением за счет включения динамики среды через прогнозирование состояния и обратные динамические цели. Оно обеспечивает значительное увеличение показателей успеха на задачах с длинными горизонтами, улучшая производительность Qwen-2.5-1.5B-Instruct с 72,8% до 77,4% на ALFWorld и с 56,8% до 67,0% на WebShop при обучении с использованием GRPO.
Обучение LLM для среды обучения RL с многомодульным рассуждением
Фреймворк LLM-как-инженер-среды использует LLM для автоматического перестройки сред обучения в области робастного обучения, анализируя траектории неудач и контекстуальные данные. На тестовой платформе MAPF-FrozenLake он превосходит более крупные проприетарные LLM и базовые статичные среды, при этом Qwen3-4B достигает наилучшей общей производительности. Анализ показывает, что доказательства неудач и сохранённые рабочие конфигурации являются ключевыми, и текущий чекпоинт RL показывает лучшую производительность, чем базовая модель как инженер среды.
VHD-Play генерирует агентные среды RL из решённых механизмов
VHD-Play — это конвейер, который генерирует разнообразные агентные среды обучения с подкреплением путём выборки и решения математических моделей, а затем преобразования их процессов принятия решений в инструменты с сохранением состояния. Этот подход гарантирует, что исполняемая динамика и эталоны оценки траекторий наследуются непосредственно из решённой модели, устраняя проблемы несогласованности, характерные для существующих конвейеров генерации.
SkillGym интернализует человеческие навыки в LLM для решения реальных задач
Исследователи представляют SkillGym — фреймворк, который преобразует написанные человеком навыки агентов в исполняемые, верифицируемые обучающие среды для агентов на основе больших языковых моделей. Система использует конвейер «навык-задача» для создания конкретных задач и проверки результатов с помощью кодовых чекеров.
ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление
Исследователи представляют ExecCritic — фреймворк, сочетающий структуру test-verify-revise с ролевым обучением с подкреплением для повышения эффективности кодогенерирующих агентов. Система разделяет создание тестов и исправление исходного кода: Test-агент генерирует тесты, специфичные для репозитория, а Repair-агент корректирует код на основе обратной связи от выполнения.