Les chercheurs présentent SkillGym, un cadre qui transforme les compétences d'agents écrites par des humains en environnements d'entraînement exécutables et vérifiables pour des agents à grands modèles de langage. Le système utilise un pipeline compétence-tâche pour instancier des tâches concrètes et vérifier les résultats avec des contrôleurs basés sur du code.
- L'équipe construit et publie 2 756 environnements répartis en 12 catégories.
- Ils collectent 8 364 trajectoires réussies, moyennant 49 appels d'outils et plus de 60k tokens de texte enregistrés.
- Le réglage fin supervisé sur des flux de travail vérifiés améliore Qwen3.5-35B-A3B de 199 Elo sur GDPval-AA v2.
- L'agent SkillGym résultant de 35B atteint 51,47 % sur SkillsBench assisté par compétences, dépassant les scores de Claude Sonnet 4.6 et GPT-5.4 Mini.
Cette approche permet l'intégration d'une compétence procédurale réutilisable, permettant aux modèles de résoudre des problèmes du monde réel plus efficacement qu'en utilisant des instructions au moment de l'inférence externe.