Los investigadores proponen SteP (Stacked LLM Policies for Web Actions), un enfoque que compone dinámicamente políticas para resolver diversas tareas web definiendo un Proceso de Decisión de Markov donde el estado es una pila de políticas. A diferencia de los métodos tradicionales restringidos a jerarquías estáticas, este método permite un control dinámico que se adapta a la complejidad de la tarea.
- En WebArena, SteP mejora el rendimiento del 14,9% al 33,5% en comparación con los métodos SOTA que utilizan políticas GPT-4.
- En MiniWob++, SteP es competitivo con trabajos previos mientras requiere significativamente menos datos.
- El enfoque aborda desafíos como tareas de mundo abierto combinatoriamente grandes y fugas de comportamiento al descomponer el control en políticas distintas llamadas dinámicamente.
Los autores consideran esto importante porque permite a los LLM manejar interfaces web complejas sin la complejidad de especificar prompts grandes para todas las posibles conductas.