Исследователи предлагают SteP (Stacked LLM Policies for Web Actions), подход, который динамически комбинирует политики для решения разнообразных веб-задач путем определения процесса марковского принятия решений, где состояние представляет собой стек политик. В отличие от традиционных методов, ограниченных статическими иерархиями, этот метод обеспечивает динамический контроль, адаптирующийся к сложности задачи.

  • На WebArena SteP улучшает производительность с 14,9% до 33,5% по сравнению с методами SOTA, использующими политики GPT-4.
  • На MiniWob++ SteP конкурентоспособен с предыдущими работами, требуя значительно меньше данных.
  • Подход решает такие проблемы, как комбинаторно большие задачи открытого мира и утечки поведения, разлагая управление на отдельные динамически вызываемые политики.

Авторы считают это важным, поскольку оно позволяет LLM обрабатывать сложные веб-интерфейсы без необходимости указывать большие промпты для всех возможных поведений.