Los investigadores presentan AgentOmnia, un marco para el escalado agéntico de escenario completo que coordina la definición del espacio de tareas, la síntesis de datos, el post-entrenamiento, la evaluación y la mejora en aplicaciones To-Consumer, To-Business y To-Employee. El sistema utiliza una taxonomía extensible y construye 5.018 entornos con estado con 255.375 herramientas y 52.361 tareas para permitir un diagnóstico fino a través de OmniaBench.
- AgentOmnia combina la síntesis bidireccional entorno-tarea con dependencias de herramientas, pipelines estructurados por programas y basados en solucionadores.
- El post-entrenamiento emplea ajuste fino supervisado, aprendizaje por refuerzo agéntico en línea y un currículo de retroceso.
- Los fallos en la evaluación generan Documentos de Requisitos del Producto para una auto-evolución dirigida.
- Partiendo de Qwen3-30B-A3B-Thinking-2507, el marco eleva la tasa de aprobación del subconjunto desafiante de OmniaBench del 9,16% al 37,11% y el promedio macro a través de cuatro benchmarks del 22,86% al 41,69%.
- El modelo lidera las líneas base agénticas post-entrenadas evaluadas en OmniaBench y supera a Qwen3-235B-A22B-Thinking-2507 en los cuatro benchmarks.
Los autores consideran esto significativo porque las ganancias abarcan tres divisiones de aplicación, diez dimensiones de capacidad, ocho factores de dificultad atómica y 76 de los 90 dominios de nivel 1, lo que indica una mejora amplia en lugar de específica por categoría.