研究者らは、To-Consumer、To-Business、To-Employeeのアプリケーション全体にわたってタスク空間の定義、データ合成、ポストトレーニング、評価、改善を調整するフルシナリオのエージェント型スケーリングのためのフレームワークであるAgentOmniaを発表した。このシステムは拡張可能な分類体系を利用し、OmniaBenchによるきめ細かい診断を可能にするために、255,375のツールと52,361のタスクを持つ5,018の状態保持環境を構築する。
- AgentOmniaは、双方向環境-タスク合成をツール依存性、プログラム構造化、およびソルバーベースのパイプラインと組み合わせる。
- ポストトレーニングでは、教師ありファインチューニング、オンラインエージェント型強化学習、およびロールバックカリキュラムを採用する。
- 評価での失敗は、ターゲットを絞った自己進化のための製品要件文書(PRD)を生成する。
- Qwen3-30B-A3B-Thinking-2507から出発し、このフレームワークはOmniaBenchの困難なサブセットのパス率を9.16%から37.11%に、4つのベンチマークのマクロ平均を22.86%から41.69%に引き上げる。
- このモデルは、OmniaBenchにおいて評価されたエージェント型ポストトレーニングのベースラインを上回り、Qwen3-235B-A22B-Thinking-2507をすべての4つのベンチマークで上回る。
著者らは、この成果が重要であると考えている。その理由は、改善が3つのアプリケーション分割、10の能力次元、8つの原子難易度因子、および90のレベル1ドメインのうち76にわたって見られることから、カテゴリ固有ではなく広範な改善を示しているためである。