研究人员提出了 AgentOmnia,这是一个用于全场景智能体扩展的框架,协调面向消费者、面向企业和面向员工应用中的任务空间定义、数据合成、后训练、评估和改进。该系统利用可扩展的分类法,构建了包含 5,018 个有状态环境、255,375 个工具和 52,361 个任务的集合,以通过 OmniaBench 实现细粒度诊断。
- AgentOmnia 结合了双向环境-任务合成与工具依赖、程序结构化以及基于求解器的流水线。
- 后训练采用监督微调、在线智能体强化学习以及回滚课程。
- 评估失败会生成产品需求文档,以进行针对性的自我进化。
- 从 Qwen3-30B-A3B-Thinking-2507 开始,该框架将 OmniaBench 挑战子集的通过率从 9.16% 提升至 37.11%,并将四个基准测试的宏观平均得分从 22.86% 提升至 41.69%。
- 该模型在 OmniaBench 上领先于已评估的智能体后训练基线,并在所有四个基准测试中超越 Qwen3-235B-A22B-Thinking-2507。
作者认为这一成果意义重大,因为收益跨越了三个应用分支、十个能力维度、八个原子难度因子以及 90 个一级领域中的 76 个,表明改进具有广泛性而非仅针对特定类别。