शोधकर्ताओं ने AgentOmnia प्रस्तुत किया, जो To-Consumer, To-Business और To-Employee अनुप्रयोगों के पार कार्य-स्थान परिभाषा, डेटा संश्लेषण, पोस्ट-ट्रेनिंग, मूल्यांकन और सुधार को समन्वित करने वाले पूर्ण-दृश्य एजेंटिक स्केलिंग के लिए एक फ्रेमवर्क है। सिस्टम एक विस्तारणीय टैक्सोनॉमी का उपयोग करता है और OmniaBench के माध्यम से सूक्ष्म-स्तर की निदान सक्षम बनाने के लिए 255,375 टूल्स और 52,361 कार्यों के साथ 5,018 स्टेटफुल एनवायरनमेंट्स का निर्माण करता है।

  • AgentOmnia बाइडायरेक्शनल एनवायरनमेंट-टास्क संश्लेषण को टूल-डिपेंडेंसी, प्रोग्राम-स्ट्रक्चर्ड और सॉल्वर-बेस्ड पाइपलाइन्स के साथ जोड़ता है।
  • पोस्ट-ट्रेनिंग में सुपरवाइज्ड फाइन-ट्यूनिंग, ऑनलाइन एजेंटिक रीइंफोर्समेंट लर्निंग और एक रोलबैक करिकुलम शामिल हैं।
  • मूल्यांकन विफलताएं लक्षित स्व-विकास के लिए प्रोडक्ट रिक्वायरमेंट डॉक्यूमेंट्स उत्पन्न करती हैं।
  • Qwen3-30B-A3B-Thinking-2507 से शुरू होकर, फ्रेमवर्क OmniaBench चुनौतीपूर्ण सबसेट पास रेट को 9.16% से बढ़ाकर 37.11% करता है और चार बेंचमार्क्स पर मैक्रो-औसत को 22.86% से 41.69% तक ले जाता है।
  • मॉडल OmniaBench पर मूल्यांकित एजेंटिक पोस्ट-ट्रेन्ड बेलाइन्स में अग्रणी है और सभी चार बेंचमार्क्स पर Qwen3-235B-A22B-Thinking-2507 को पार करता है।

लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि लाभ तीन अनुप्रयोग स्प्लिट्स, दस क्षमता आयामों, आठ एटॉमिक-डिफिकल्टी फैक्टर्स और 90 लेवल-1 डोमेन्स में से 76 में फैले हुए हैं, जो श्रेणी-विशिष्ट सुधार के बजाय व्यापक सुधार को इंगित करता है।