Pesquisadores propõem o SteP (Stacked LLM Policies for Web Actions), uma abordagem que compõe dinamicamente políticas para resolver diversas tarefas web definindo um Processo de Decisão de Markov onde o estado é uma pilha de políticas. Diferente dos métodos tradicionais restritos a hierarquias estáticas, este método permite controle dinâmico que se adapta à complexidade da tarefa.
- No WebArena, o SteP melhora o desempenho de 14,9% para 33,5% em relação aos métodos SOTA que usam políticas GPT-4.
- No MiniWob++, o SteP é competitivo com trabalhos anteriores enquanto requer significativamente menos dados.
- A abordagem aborda desafios como tarefas de mundo aberto combinatoriamente grandes e vazamentos de comportamento ao decompor o controle em políticas distintas chamadas dinamicamente.
Os autores consideram isso importante porque permite que LLMs lidem com interfaces web complexas sem a complexidade de especificar prompts grandes para todos os possíveis comportamentos.