연구자들은 상태를 정책의 스택으로 정의하는 마르코프 결정 과정을 통해 다양한 웹 작업을 해결하기 위해 정책을 동적으로 조합하는 접근 방식인 SteP(Stacked LLM Policies for Web Actions)을 제안합니다. 정적 계층 구조에 제한된 기존 방법과 달리 이 방법은 작업 복잡성에 적응하는 동적 제어를 가능하게 합니다.

  • WebArena에서 SteP은 GPT-4 정책을 사용하는 SOTA 방법 대비 성능을 14.9%에서 33.5%로 향상시켰습니다.
  • MiniWob++에서 SteP은 기존 연구와 경쟁력 있으면서도 훨씬 적은 데이터를 요구합니다.
  • 이 접근 방식은 제어를 개별적으로 동적으로 호출되는 정책으로 분해하여 조합적으로 큰 오픈 월드 작업과 행동 유출과 같은 과제를 해결합니다.

저자들은 이것이 모든 가능한 행동에 대해 큰 프롬프트를 지정하는 복잡성 없이 LLM이 복잡한 웹 인터페이스를 처리할 수 있게 하기 때문에 중요하다고 생각합니다.