Les chercheurs proposent SteP (Stacked LLM Policies for Web Actions), une approche qui compose dynamiquement des politiques pour résoudre diverses tâches web en définissant un Processus de Décision de Markov où l'état est une pile de politiques. Contrairement aux méthodes traditionnelles limitées à des hiérarchies statiques, cette méthode permet un contrôle dynamique qui s'adapte à la complexité de la tâche.

  • Sur WebArena, SteP améliore les performances de 14,9 % à 33,5 % par rapport aux méthodes SOTA utilisant des politiques GPT-4.
  • Sur MiniWob++, SteP est compétitif avec les travaux antérieurs tout en nécessitant significativement moins de données.
  • L'approche aborde des défis tels que les tâches du monde ouvert combinatoirement grandes et les fuites de comportement en décomposant le contrôle en politiques distinctes appelées dynamiquement.

Les auteurs considèrent cela important car cela permet aux LLM de gérer des interfaces web complexes sans la complexité de spécifier de grands prompts pour tous les comportements possibles.