연구진은 SkillGym을 소개합니다. 이는 인간이 작성한 에이전트 기술을 대형 언어 모델 에이전트를 위한 실행 가능하고 검증 가능한 학습 환경으로 변환하는 프레임워크입니다. 이 시스템은 기술-작업 파이프라인을 활용하여 구체적인 작업을 인스턴스화하고 코드 기반 체크기로 결과를 검증합니다.

  • 팀은 12개 범주에 걸쳐 2,756개의 환경을 구축하고 공개했습니다.
  • 평균 49회의 도구 호출과 60,000개 이상의 로깅된 텍스트 토큰을 포함하는 8,364개의 성공적인 궤적을 수집했습니다.
  • 검증된 워크플로우에 대한 지도 미세 조정으로 Qwen3.5-35B-A3B의 GDPval-AA v2에서 Elo 점수가 199점 향상되었습니다.
  • 결과적으로 생성된 35B SkillGym-Agent는 기술 보조 SkillsBench에서 51.47%의 점수를 달성하여 Claude Sonnet 4.6과 GPT-5.4 Mini의 점수를 초과했습니다.

이 접근 방식은 재사용 가능한 절차적 능력의 내재화를 가능하게 하여, 외부 추론 시간 지시문을 사용하는 것보다 모델이 현실 문제를 더 효과적으로 해결할 수 있도록 합니다.