Pesquisadores propõem o SteP (Stacked LLM Policies for Web Actions), uma abordagem que compõe dinamicamente políticas para resolver diversas tarefas web definindo um Processo de Decisão de Markov onde o estado é uma pilha de políticas. Diferente dos métodos tradicionais restritos a hierarquias estáticas, este método permite controle dinâmico que se adapta à complexidade da tarefa.

  • No WebArena, o SteP melhora o desempenho de 14,9% para 33,5% em relação aos métodos SOTA que usam políticas GPT-4.
  • No MiniWob++, o SteP é competitivo com trabalhos anteriores enquanto requer significativamente menos dados.
  • A abordagem aborda desafios como tarefas de mundo aberto combinatoriamente grandes e vazamentos de comportamento ao decompor o controle em políticas distintas chamadas dinamicamente.

Os autores consideram isso importante porque permite que LLMs lidem com interfaces web complexas sem a complexidade de especificar prompts grandes para todos os possíveis comportamentos.