Peneliti mengusulkan SteP (Stacked LLM Policies for Web Actions), sebuah pendekatan yang secara dinamis menyusun kebijakan untuk menyelesaikan berbagai tugas web dengan mendefinisikan Proses Keputusan Markov di mana keadaan adalah tumpukan kebijakan. Berbeda dengan metode tradisional yang terbatas pada hierarki statis, metode ini memungkinkan kontrol dinamis yang beradaptasi dengan kompleksitas tugas.

  • Di WebArena, SteP meningkatkan kinerja dari 14,9% menjadi 33,5% dibandingkan metode SOTA yang menggunakan kebijakan GPT-4.
  • Di MiniWob++, SteP kompetitif dengan karya sebelumnya sambil membutuhkan data secara signifikan lebih sedikit.
  • Pendekatan ini mengatasi tantangan seperti tugas dunia terbuka yang sangat besar secara kombinatorial dan kebocoran perilaku dengan menguraikan kontrol menjadi kebijakan berbeda yang dipanggil secara dinamis.

Para penulis menganggap ini penting karena memungkinkan LLM menangani antarmuka web kompleks tanpa kompleksitas menentukan prompt besar untuk semua perilaku yang mungkin.