शोधकर्ताओं ने मिड-हार्नेस पेश किया, एक विधि जो टर्मिनल एजेंट्स में निष्पादन विश्वसनीयता को बेहतर बनाने के लिए मॉडल-हार्नेस सीमा पर उम्मीदवार एक्शन का नमूना लेती और सत्यापित करती है। यह दृष्टिकोण एक एक्शन को निष्पादन के लिए आगे बढ़ाने से पहले कई विकल्पों की पुष्टि करके टेस्ट-टाइम कंप्यूट आवंटित करता है, जनरेटर और हार्नेस को अपरिवर्तित रखते हुए।

  • टर्मिनलबेंच-लाइट पर, 8 नमूना एक्शन के साथ GPT-5.6 Sol सत्यापक का उपयोग करने से बेस एजेंट की तुलना में Pass@1 को 50.00% से बढ़ाकर 68.03% किया गया है।
  • जब TMAX-9B सत्यापक के रूप में कार्य करता है, तो पेयरवाइज सत्यापन मूल्यांकित तंत्रों में सबसे अच्छे परिणाम देता है।
  • एक मजबूत सत्यापक से प्रतिक्रियाओं को TMAX-9B में विलीन करना एक्शन जनरेटर को बदले बिना Pass@1 को और बेहतर बनाता है।
  • TMAX-9B के साथ एक्शन और ट्राजेक्टरी स्केलिंग को जोड़ने से अधिक अनुमानित टोकन लागत पर कम में अधिक सफलता प्राप्त होती है, जबकि केवल अधिक ट्राजेक्ट्री जनरेट करने की तुलना में।

इन निष्कर्षों ने टर्मिनल एजेंट्स में टेस्ट-टाइम कंप्यूट स्केलिंग के लिए एक्शन स्केलिंग को एक वादाजनक लक्ष्य के रूप में पहचाना है, जो अतिरिक्त मॉडलों, बेंचमार्क्स और हार्नेसों पर प्रदर्शन में सुधार करता है।