Google Cloud AI Research, स्टैन लुइस में वॉशिंगटन यूनिवर्सिटी और UNC Chapel Hill की एक टीम ने EnvHarness जारी किया है, जो एक प्रोग्राम करने योग्य परत है जो स्थिर एजेंट बेंचमार्क्स को अनुकूलित प्रशिक्षण दुनियाओं में बदल देती है। सिस्टम मौजूदा वातावरण को मानक reset() और step() इंटरफ़ेस के माध्यम से काम करने वाले प्लग-इन घटकों का उपयोग करके लपेटता है, जिससे वातावरण नीति के प्रशिक्षण के अनुसार अनुकूलित हो सकता है, बिना मूल सिमुलेटर या मानव द्वारा निर्मित सत्यापनकर्ताओं को बदले।
- EnvHarness एक LLM डिज़ाइनर EnvRigger का उपयोग करता है जो नीति की रोलआउट में कमियों का पता लगाता है और लक्षित व्रैपर स्वचालित रूप से लिखता है।
- सिस्टम में तीन संयोज्य घटक शामिल हैं: Stage (शुरुआती अवस्थाओं को पुनर्लेखित करता है), Contract (क्रियाओं और अवलोकनों पर प्रति-चरण हुक स्थापित करता है), और Chain (साझा बजट के तहत दूसरे वातावरणों को संयोजित करता है)।
- ALFWorld, WebArena, SWE-bench Verified, OfficeQA, और SpreadsheetBench सहित पांच बेंचमार्क्स पर, EnvHarness के माध्यम से खोदे गए कौशल हटाई गई कार्यों पर 9.0 अंक तक बढ़ाते हैं।
- SWE-bench Verified पर, दृष्टिकोण औसत निष्पादन चरणों को 9.8% कम करता है और समाधान दरों को 49.88 से 52.58 तक बढ़ाता है।
- कोड Apache-2.0 Python के रूप में उपलब्ध है, जिसके लिए केवल एक रीसेट करने योग्य वातावरण और मौजूदा एजेंट मूल्यांकन लूप की आवश्यकता होती है।
लेखक इसे महत्वपूर्ण मानते हैं क्योंकि स्थिर वातावरण हल होने पर सिखाना बंद कर देते हैं, जबकि EnvHarness एजेंटों को प्रशिक्षण के दौरान पहचानी गई विशिष्ट कमियों को लक्षित करके सीखने जारी रखने की अनुमति देता है।