शोधकर्ताओं ने SteP (Stacked LLM Policies for Web Actions) का प्रस्ताव दिया, एक दृष्टिकोण जो विविध वेब कार्यों को हल करने के लिए नीतियों को गतिशील रूप से संयोजित करता है, जहां राज्य नीतियों के स्टैक के रूप में परिभाषित मार्कोव निर्णय प्रक्रिया द्वारा परिभाषित किया जाता है। पारंपरिक विधियों के विपरीत जो स्थिर हियरार्की तक सीमित हैं, यह विधि कार्य की जटिलता के अनुसार अनुकूलित होने वाला गतिशील नियंत्रण सक्षम बनाती है।

  • WebArena पर, SteP ने GPT-4 नीतियों का उपयोग करने वाले SOTA विधियों की तुलना में प्रदर्शन को 14.9% से 33.5% तक बढ़ा दिया।
  • MiniWob++ पर, SteP पूर्व कार्यों के साथ प्रतिस्पर्धी है जबकि काफी कम डेटा की आवश्यकता होती है।
  • दृष्टिकोण नियंत्रण को अलग-अलग, गतिशील रूप से कॉल किए जाने वाली नीतियों में विघटित करके संयोजनात्मक रूप से बड़े ओपन-वर्ल्ड कार्यों और व्यवहार लीक जैसे चुनौतियों का समाधान करता है।

लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि यह LLMs को सभी संभावित व्यवहारों के लिए बड़े प्रॉम्प्ट निर्दिष्ट करने की जटिलता के बिना जटिल वेब इंटरफेस को संभालने की अनुमति देता है।