Microsoft Research는 자율 에이전트에 대한 확장 가능하고 비용 효율적인 연구를 가능하게 하기 위해 설계된 오픈소스 프레임워크인 Orchard를 출시했습니다. 이 시스템은 소프트웨어 엔지니어링, 웹 탐색, 개인 비서 등 다양한 도메인에서 에이전트를 훈련하고 평가할 수 있는 Kubernetes 기반 환경 서비스인 Orchard Env를 중심으로 합니다.
- Orchard-SWE는 약 30억 개의 활성 파라미터를 사용하여 SWE-bench Verified에서 69.7%의 성능을 달성했으며, 가치 모델 재랭킹을 통해 73%에 도달했습니다.
- Orchard-GUI는 WebVoyager, Online-Mind2Web, DeepShop 벤치마크 전반에 걸쳐 평균 68.4%를 달성하기 위해 40억 파라미터 규모의 비전-언어 모델을 훈련합니다.
- 이 프레임워크는 Codex와 OpenClaw와 같은 실제 배포 하네시 내에서 에이전트를 직접 훈련할 수 있어 훈련과 배포 환경 간의 격차를 해소합니다.
이번 출시에는 더 넓은 연구 커뮤니티가 오픈 에이전트 시스템을 구축하고 연구하는 데 도움이 되는 훈련 데이터와 평가 방법이 포함되어 있으며, 현재 에이전트형 AI 개발에서 독점 인프라의 병목 현상을 해결합니다.