يقترح الباحثون SteP (Stacked LLM Policies for Web Actions)، وهو نهج يركب السياسات ديناميكيًا لحل مهام ويب متنوعة من خلال تعريف عملية قرار ماركوف حيث تكون الحالة عبارة عن رصة من السياسات. وعلى عكس الطرق التقليدية المقيدة بالهرميات الثابتة، يتيح هذا الأسلوب تحكمًا ديناميكيًا يتكيف مع تعقيد المهمة.
- على WebArena، يحسن SteP الأداء من 14.9% إلى 33.5% مقارنة بطرق SOTA التي تستخدم سياسات GPT-4.
- على MiniWob++، يكون SteP منافسًا للأعمال السابقة بينما يتطلب بيانات أقل بشكل كبير.
- يتناول النهج تحديات مثل المهام المفتوحة واسعة النطاق بشكل توافقي وتسرب السلوك من خلال تفكيك التحكم إلى سياسات منفصلة يتم استدعاؤها ديناميكيًا.
يعتقد المؤلفون أن هذا مهم لأنه يسمح لـ LLMs بالتعامل مع واجهات ويب معقدة دون تعقيد تحديد نصوص توجيهية كبيرة لجميع السلوكيات الممكنة.