Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.
- El equipo construye y libera 2,756 entornos en 12 categorías.
- Recopilan 8,364 trayectorias exitosas que promedian 49 llamadas de herramientas y más de 60k tokens de texto registrados.
- El ajuste fino supervisado en flujos de trabajo verificados mejora Qwen3.5-35B-A3B en 199 Elo en GDPval-AA v2.
- El SkillGym-Agent resultante de 35B alcanza 51.47% en SkillsBench asistido por habilidades, superando las puntuaciones de Claude Sonnet 4.6 y GPT-5.4 Mini.
Este enfoque permite la internalización de competencia procedimental reutilizable, permitiendo que los modelos resuelvan problemas del mundo real de manera más efectiva que usando instrucciones de inferencia externas.