TRL v1.14 добавляет поддержку LoRA для AsyncGRPOTrainer, позволяя обучать адаптер Low-Rank Adaptation и синхронизировать только этот небольшой файл с inference-воркерами vLLM. Эта архитектура разделяет задачи обучения и генерации на разных машинах, используя общий Storage Bucket в качестве файлового моста, что устраняет необходимость в NCCL или прямой сетевой коммуникации между узлами.
- Адаптер rank-1 занимает всего несколько мегабайт, что позволяет передавать его через смонтированный Storage Bucket вместо использования NCCL.
- Trainer и реплики vLLM запускаются как отдельные Hugging Face Jobs на разных машинах.
- Прокси-сервер добавляет заголовки аутентификации и маршрутизирует rollout'ы к реплике, содержащей соответствующий KV-prefix, одновременно транслируя обновления адаптера.
- Пять запусков сократили время обучения для 500 шагов с 3 часов 27 минут до 53 минут.
Эта конфигурация позволяет AsyncGRPOTrainer эффективно работать в распределённых средах, где узлы не могут разделять локальный диск или формировать NCCL-группу, что значительно ускоряет процессы обучения с подкреплением.