Исследователи представляют AgentOmnia — фреймворк для масштабирования агентных моделей в приложениях полного цикла, который координирует определение пространства задач, синтез данных, постобучение, оценку и улучшение для приложений To-Consumer, To-Business и To-Employee. Система использует расширяемую таксономию и создаёт 5018 состоятельных окружений с 255375 инструментами и 52361 задачей, чтобы обеспечить детализированную диагностику через OmniaBench.

  • AgentOmnia объединяет двунаправленный синтез окружения и задачи с конвейерами на основе зависимостей инструментов, программной структуры и решателей.
  • Постобучение использует контролируемое тонкое донастраивание, онлайн агентное обучение с подкреплением и откатную учебную программу.
  • Ошибки оценки генерируют Документы продуктовых требований для целевой самоэволюции.
  • Начиная с Qwen3-30B-A3B-Thinking-2507, фреймворк повышает долю успешных прохождений сложного подмножества OmniaBench с 9,16% до 37,11%, а макро-среднее значение по четырём бенчмаркам — с 22,86% до 41,69%.
  • Модель лидирует среди оценённых агентных базовых моделей после постобучения на OmniaBench и превосходит Qwen3-235B-A22B-Thinking-2507 по всем четырём бенчмаркам.

Авторы считают это значимым, поскольку улучшения охватывают три раздела приложений, десять измерений способностей, восемь факторов атомарной сложности и 76 из 90 доменов первого уровня, что указывает на широкое, а не узкоспециализированное улучшение.