टूल-यूज़िंग एजेंट्स के लिए एक नया कोरूटीन-ब्रिज हार्नेस ने CAR-bench मूल्यांकन के ट्रैक 2 में जीत हासिल की, आधिकारिक छिपे हुए टेस्ट सेट पर 60.0% Pass@3 स्कोर प्राप्त किया। सिस्टम मॉडल इन्वोकेशन को टूल राउंड-ट्रिप्स से अलग करता है, जिसमें मॉडल पायथन प्रोग्राम उत्पन्न करता है जो एvaluator आदान-प्रदान के दौरान ब्लॉक और रीज्यूम होते हैं।
- एजेंट प्रति टास्क सात एजेंट टर्न्स के खिलाफ दो मॉडल कॉल्स का माध्यिका उपयोग करता है, Cerebras gpt-oss-120b पर मॉडल लेटेंसी के 1.8 सेकंड की माध्यिका में टास्क को हल करता है।
- इसने बेसलाइन से ऊपर स्कोर करने वाले एंट्रीज में सबसे कम अनुमानित लागत और सबसे तेज़ माध्यिका टास्क लेटेंसी (3.14 s) पर आयोजक बेसलाइन की 4.5 गुना प्रदर्शन हासिल किया।
- अपरिवर्तित हार्नेस ने Open ट्रैक में GPT-5.5 पर समान 60.0% Pass@3 को पुनः उत्पन्न किया, जो फ्रंटियर-मॉडल एजेंट्स के बराबर है।
- एक स्थिर प्रॉम्प्ट ने इनपुट टोकन्स का 78% कैश से सेवा दी, जिसने सामान्य इनपुट कंप्यूट को काफी कम कर दिया।
यह दृष्टिकोण टूल परत में तार्किक नियमों के रूप में निर्धारित नीतियों को एन्कोड करके शून्य तर्क लागत पर अनुपालन सुनिश्चित करता है, न कि प्रॉम्प्ट नियमों के माध्यम से।