Les chercheurs présentent AgentOmnia, un cadre d'échelle agentique pour des scénarios complets qui coordonne la définition de l'espace de tâches, la synthèse de données, le post-entraînement, l'évaluation et l'amélioration dans les applications To-Consumer, To-Business et To-Employee. Le système utilise une taxonomie extensible et construit 5 018 environnements avec état dotés de 255 375 outils et 52 361 tâches pour permettre un diagnostic fin via OmniaBench.
- AgentOmnia combine la synthèse bidirectionnelle environnement-tâche avec des pipelines basés sur la dépendance aux outils, structurés par programme et fondés sur des solveurs.
- Le post-entraînement emploie l'ajustement fin supervisé, l'apprentissage par renforcement agentique en ligne et un curriculum de retour arrière.
- Les échecs d'évaluation génèrent des Documents de Spécification Produit pour une auto-évolution ciblée.
- En partant de Qwen3-30B-A3B-Thinking-2507, le cadre élève le taux de réussite du sous-ensemble difficile d'OmniaBench de 9,16 % à 37,11 % et la moyenne macro sur quatre benchmarks de 22,86 % à 41,69 %.
- Le modèle domine les bases de référence post-entraînées agentiques évaluées sur OmniaBench et dépasse Qwen3-235B-A22B-Thinking-2507 sur les quatre benchmarks.
Les auteurs considèrent cela significatif car les gains s'étendent à trois partitions d'application, dix dimensions de capacité, huit facteurs de difficulté atomique et 76 des 90 domaines de niveau 1, indiquant une amélioration large plutôt que spécifique à une catégorie.