A Microsoft Research Asia disponibilizou como código aberto o Agent Lightning v1.0, um framework leve que implementa o paradigma de treinamento "Harnessed Agentic RL". Essa abordagem permite que o aprendizado por reforço utilize o mesmo agente de produção, eliminando a necessidade de reimplementar a lógica do agente dentro do sistema de treinamento.
- O framework consiste em aproximadamente 3.500 linhas de código e inclui um API Gateway, Rollout Controller e Customized Trainer.
- Suporta execução nativa no Kubernetes para agentes em clusters auto geridos, infraestrutura em nuvem ou ambientes locais sem dependências comerciais de sandbox.
- Um pipeline de agente de codificação end-to-end usando Qwen3.5-9B alcançou um ganho de 14,6 pontos percentuais no SWE-bench Verified, elevando o Pass@1 de 41,8% para 56,4% com apenas cerca de 6.000 amostras de treinamento.
Este design permite que pesquisadores e desenvolvedores treinem agentes diretamente com seus harnesses de implantação existentes, garantindo que o modelo treinado se comporte idêntico ao sistema implantado enquanto mantém um pipeline simples e reproduzível.