Microsoft Research Asia ha liberado como código abierto Agent Lightning v1.0, un marco de trabajo ligero que implementa el paradigma de entrenamiento "Harnessed Agentic RL". Este enfoque permite que el aprendizaje por refuerzo utilice el mismo agente de producción desplegado, eliminando la necesidad de reimplementar la lógica del agente dentro del sistema de entrenamiento.

  • El marco de trabajo consta de aproximadamente 3.500 líneas de código e incluye un API Gateway, Rollout Controller y Customized Trainer.
  • Admite ejecución nativa en Kubernetes para agentes en clústeres autoadministrados, infraestructura en la nube o entornos locales sin dependencias de sandbox comerciales.
  • Una canalización de agente de codificación de extremo a extremo utilizando Qwen3.5-9B logró un aumento de 14,6 puntos porcentuales en SWE-bench Verified, elevando Pass@1 del 41,8% al 56,4% con solo alrededor de 6.000 muestras de entrenamiento.

Este diseño permite a investigadores y desarrolladores entrenar agentes directamente con sus marcos de despliegue existentes, asegurando que el modelo entrenado se comporte idénticamente al sistema desplegado mientras mantiene una canalización simple y reproducible.