Les chercheurs présentent SkillGym, un cadre qui transforme les compétences d'agents écrites par des humains en environnements d'entraînement exécutables et vérifiables pour des agents à grands modèles de langage. Le système utilise un pipeline compétence-tâche pour instancier des tâches concrètes et vérifier les résultats avec des contrôleurs basés sur du code.

  • L'équipe construit et publie 2 756 environnements répartis en 12 catégories.
  • Ils collectent 8 364 trajectoires réussies, moyennant 49 appels d'outils et plus de 60k tokens de texte enregistrés.
  • Le réglage fin supervisé sur des flux de travail vérifiés améliore Qwen3.5-35B-A3B de 199 Elo sur GDPval-AA v2.
  • L'agent SkillGym résultant de 35B atteint 51,47 % sur SkillsBench assisté par compétences, dépassant les scores de Claude Sonnet 4.6 et GPT-5.4 Mini.

Cette approche permet l'intégration d'une compétence procédurale réutilisable, permettant aux modèles de résoudre des problèmes du monde réel plus efficacement qu'en utilisant des instructions au moment de l'inférence externe.