Microsoft Research Asia a open-sourcé Agent Lightning v1.0, un framework léger implémentant le paradigme d'entraînement « Harnessed Agentic RL ». Cette approche permet à l'apprentissage par renforcement d'utiliser le même harnais agent déployé en production, éliminant ainsi la nécessité de réimplémenter la logique agent au sein du système d'entraînement.

  • Le framework comprend environ 3 500 lignes de code et inclut une passerelle API, un contrôleur de rollout et un entraîneur personnalisé.
  • Il prend en charge l'exécution native sur Kubernetes pour les agents sur des clusters auto-gérés, une infrastructure cloud ou des environnements locaux, sans dépendances de sandbox commerciales.
  • Un pipeline d'agent de codage de bout en bout utilisant Qwen3.5-9B a obtenu un gain de 14,6 points de pourcentage sur SWE-bench Verified, faisant passer le Pass@1 de 41,8 % à 56,4 % avec seulement environ 6 000 échantillons d'entraînement.

Cette conception permet aux chercheurs et développeurs d'entraîner des agents directement avec leurs harnais de déploiement existants, garantissant que le modèle entraîné se comporte identiquement au système déployé tout en maintenant un pipeline simple et reproductible.