TRL v1.14 memperkenalkan dukungan LoRA ke AsyncGRPOTrainer, memungkinkannya melatih adapter Low-Rank Adaptation dan menyinkronkan hanya file kecil tersebut ke pekerja inferensi vLLM. Arsitektur ini memisahkan tugas pelatihan dan generasi pada mesin yang berbeda dengan menggunakan Storage Bucket bersama sebagai jembatan filesystem, menghilangkan kebutuhan akan NCCL atau komunikasi jaringan langsung antar node.
- Adapter rank-1 hanya berukuran beberapa megabyte, memungkinkannya berpindah melalui Storage Bucket yang terpasang alih-alih melalui NCCL.
- Trainer dan replika vLLM berjalan sebagai Hugging Face Jobs terpisah pada mesin yang berbeda.
- Server proksi menambahkan header autentikasi dan mengarahkan rollouts ke replika yang memegang prefix KV relevan sambil menyiarkan pembaruan adapter.
- Lima kali percobaan mengurangi waktu pelatihan untuk 500 langkah dari 3 jam 27 menit menjadi 53 menit.
Konfigurasi ini memungkinkan AsyncGRPOTrainer beroperasi secara efektif di lingkungan terdistribusi di mana node tidak dapat berbagi disk lokal atau membentuk grup NCCL, secara signifikan mempercepat alur kerja pembelajaran penguatan.