Para peneliti memperkenalkan SkillGym, sebuah kerangka kerja yang mengubah keterampilan agen yang ditulis oleh manusia menjadi lingkungan pelatihan yang dapat dieksekusi dan diverifikasi untuk agen model bahasa besar. Sistem ini memanfaatkan pipeline skill-to-task untuk menginisialisasi tugas konkret dan memverifikasi hasil dengan checker berbasis kode.
- Tim membangun dan merilis 2.756 lingkungan di 12 kategori.
- Mereka mengumpulkan 8.364 trajektori sukses dengan rata-rata 49 panggilan alat dan lebih dari 60k token teks yang tercatat.
- Fine-tuning terawasi pada alur kerja yang diverifikasi meningkatkan Qwen3.5-35B-A3B sebesar 199 Elo pada GDPval-AA v2.
- SkillGym-Agent 35B yang dihasilkan mencapai 51,47% pada skill-assisted SkillsBench, melampaui skor Claude Sonnet 4.6 dan GPT-5.4 Mini.
Pendekatan ini memungkinkan internalisasi kompetensi prosedural yang dapat digunakan kembali, memungkinkan model memecahkan masalah dunia nyata lebih efektif dibandingkan menggunakan instruksi inference-time eksternal.