연구자들은 AgentOmnia를 제시했는데, 이는 To-Consumer, To-Business, To-Employee 애플리케이션 전반에 걸쳐 작업 공간 정의, 데이터 합성, 사후 훈련, 평가 및 개선을 조정하는 전 시나리오 에이전트 스케일링을 위한 프레임워크입니다. 이 시스템은 확장 가능한 분류 체계를 활용하고 OmniaBench를 통한 세밀한 진단을 가능하게 하기 위해 255,375개의 도구와 52,361개의 작업을 갖춘 5,018개의 상태 환경(stateful environments)을 구성합니다.
- AgentOmnia는 도구 의존성, 프로그램 구조화 및 솔버 기반 파이프라인과 결합된 양방향 환경-작업 합성을 통합합니다.
- 사후 훈련은 지도 미세 조정(supervised fine-tuning), 온라인 에이전트 강화 학습(online agentic reinforcement learning) 및 롤백 커리큘럼(rollback curriculum)을 사용합니다.
- 평가 실패는 표적 자기 진화를 위한 제품 요구 사항 문서(Product Requirement Documents)를 생성합니다.
- Qwen3-30B-A3B-Thinking-2507에서 시작하여 이 프레임워크는 OmniaBench의 어려운 하위 집합 통과율을 9.16%에서 37.11%로, 네 가지 벤치마크에 걸친 매크로 평균을 22.86%에서 41.69%로 높입니다.
- 이 모델은 OmniaBench에서 평가된 에이전트 사후 훈련 기반 모델(baselines)을 선도하며 모든 네 가지 벤치마크에서 Qwen3-235B-A22B-Thinking-2507을 능가합니다.
저자들은 이것이 세 가지 애플리케이션 분할, 열 가지 능력 차원, 여덟 개의 원자적 난이도 요인 및 90개 레벨-1 도메인 중 76개에 걸쳐 이득이 발생하므로 중요하다고 간주하며, 이는 범주별 개선이 아닌 광범위한 개선을 나타냅니다.