Trase ने Hugging Face के GAIA बेंचमार्क में नंबर एक स्थान सुरक्षित किया, जो तर्क और उपकरण उपयोग सहित वास्तविक दुनिया के AI एजेंट क्षमताओं को मापने वाला एक परीक्षण है, जिसमें Meta, Microsoft और अन्य की सबमिशन को पीछे छोड़ा।
- Trase ने 450+ प्रश्नों वाले बेंचमार्क पर 35.55% की समग्र सफलता दर हासिल की।
- सिस्टम मानव-समान क्रिया पथों पर फाइन-ट्यून्ड STaR (Self-Taught Reasoner) के माध्यम से पुनरावृत्त स्वयं-सुधार का उपयोग करता है।
- यह आधार LLM क्रियाओं को कोड के साथ बढ़ाता है ताकि कई उपकरण कॉल को एकल कोड क्रिया में संयोजित किया जा सके।
- एक शीर्ष-स्तरीय एजेंट स्वयं-आलोचना करता है यह निर्धारित करने के लिए कि क्या पर्याप्त जानकारी इकट्ठा हो गई है, इससे पहले कि उपकरण बदला जाए या विशेषज्ञ एजेंट को कॉल किया जाए।
लेख में नोट किया गया है कि जटिल कार्यों में मानवों को प्रतिस्थापित करने के लिए 90% proficiency को सीमा रेखा माना जाता है, जो Trase प्राप्त करना चाहता है।