OpenAI द्वारा Deep Research के प्रकाशन के बाद, एक टीम ने 24 घंटों में इसके एजेंटिक फ्रेमवर्क का पुनरुत्पादन किया और smolagents लाइब्रेरी के माध्यम से इसे ओपन-सोर्स कर दिया। परिणामी सिस्टम बहु-चरण तर्क कार्यों को करने के लिए वेब ब्राउज़िंग और पाठ निरीक्षण के लिए उपकरणों के साथ एक LLM को एकीकृत करता है।

  • पुनरुत्पादन "कोड एजेंट" आर्किटेक्चर का उपयोग करता है, जिससे मॉडल कार्यों को JSON के बजाय कोड के रूप में व्यक्त कर सकता है, जिससे टोकन उपयोग कम होता है और स्थिति प्रबंधन बेहतर होता है।
  • GAIA वैलिडेशन सेट पर, ओपन-सोर्स सिस्टम ने 55.15% प्राप्त किया, जो Magentic-One द्वारा रखे गए पिछले शीर्ष स्कोर 46% को पार करता है।
  • यह प्रदर्शन समान बेंचमार्क पर अकेले GPT-4 के लगभग 7% स्कोर से काफी अधिक है और OpenAI द्वारा रिपोर्ट किए गए 67.36% के करीब पहुंचता है।
  • टीम का मानना है कि पूर्ण समानता प्राप्त करने के लिए वर्तमान केवल-पाठ कार्यान्वयन से परे अधिक उन्नत ब्राउज़र इंटरैक्शन क्षमताओं की आवश्यकता होगी।

लेखक इसे महत्वपूर्ण मानते हैं क्योंकि यह दर्शाता है कि ओपन-सोर्स एजेंटिक फ्रेमवर्क्स ज्ञान-केंद्रित जटिल बेंचमार्क्स पर LLM प्रदर्शन को काफी बढ़ा सकते हैं, बिना किसी स्वामित्व वाले मॉडल पर निर्भर हुए।