लेखकों ने Growing Harness पेश किया, जो एक प्रशिक्षण पैराडाइम है जो कार्य फीडबैक से एजेंट के नियंत्रण संरचना को सीखता है, न कि भारी संदर्भ वाले हार्नेस पर निर्भर रहकर। दोहराए जाने वाले नियंत्रण निर्णयों को निष्पादन योग्य कोड में बदलकर और अर्थपूर्ण तर्क के लिए LLM कॉल को सुरक्षित रखकर, इस विधि का उद्देश्य पुनः उपयोग योग्य विशेषज्ञ एजेंट बनाना है।
- Growing Harness स्थिर इंटरफेस के साथ एक रणनीति-रहित ढांचा का उपयोग करता है, जो फ़ंक्शन-स्तर निष्पादन ट्रेस के माध्यम से विफलताओं को स्थानीयकृत करता है।
- एक ऑप्टिमाइज़र विफलताओं की खिड़कियों को संयुक्त रूप से मरम्मत करता है, जबकि सफलता-पहले गेट ऐसे संशोधनों को रोलबैक करता है जो पूर्व क्षमता को हानि पहुंचाते हैं।
- 4B से 120B पैरामीटर तक के मॉडल के साथ BrowseComp-Plus और WebArena-Verified पर, इसने छह सेटिंग्स में पांच में उच्चतम औसत सफलता हासिल की।
- यह Tool-Calling एजेंट के सापेक्ष LLM कॉल को 76.0-91.8% और तैनात-एजेंट इनफरेंस लागत को 74.4-98.6% कम करता है।
- WebArena-Verified पर, सफलता मॉडल स्केल के साथ 44.7-45.3% पर स्थिर रहती है, जबकि Tool-Calling 4B मॉडल के साथ 6.7% तक गिर जाता है।
स्थायी प्रोग्राम वृद्धि दोहराए जाने वाले नियंत्रण को मॉडल संदर्भ से निकालकर कम लागत वाले कोड में ले जाती है, जिससे एजेंट छोटे मॉडल के साथ तैनात होने पर भी प्रभावी रहते हैं।