Исследователи представляют AgentOmnia — фреймворк для масштабирования агентных моделей в приложениях полного цикла, который координирует определение пространства задач, синтез данных, постобучение, оценку и улучшение для приложений To-Consumer, To-Business и To-Employee. Система использует расширяемую таксономию и создаёт 5018 состоятельных окружений с 255375 инструментами и 52361 задачей, чтобы обеспечить детализированную диагностику через OmniaBench.
- AgentOmnia объединяет двунаправленный синтез окружения и задачи с конвейерами на основе зависимостей инструментов, программной структуры и решателей.
- Постобучение использует контролируемое тонкое донастраивание, онлайн агентное обучение с подкреплением и откатную учебную программу.
- Ошибки оценки генерируют Документы продуктовых требований для целевой самоэволюции.
- Начиная с Qwen3-30B-A3B-Thinking-2507, фреймворк повышает долю успешных прохождений сложного подмножества OmniaBench с 9,16% до 37,11%, а макро-среднее значение по четырём бенчмаркам — с 22,86% до 41,69%.
- Модель лидирует среди оценённых агентных базовых моделей после постобучения на OmniaBench и превосходит Qwen3-235B-A22B-Thinking-2507 по всем четырём бенчмаркам.
Авторы считают это значимым, поскольку улучшения охватывают три раздела приложений, десять измерений способностей, восемь факторов атомарной сложности и 76 из 90 доменов первого уровня, что указывает на широкое, а не узкоспециализированное улучшение.