研究者らは、モデルの事前学習データとの整合性を高めるために観測空間と行動空間を精緻化することでパフォーマンスを改善する、LLMベースのWebエージェントのためのベースラインであるAgentOccamを紹介しました。このアプローチは、コンテキスト内例やマルチエージェントシステムなどの手作業による戦略の必要性を排除します。

  • WebArenaベンチマークにおいて、AgentOccamは以前のstate-of-the-art手法を絶対値で9.8ポイント(+29.4%)、同時期の研究を5.9ポイント(+15.8%)上回りました。
  • この手法は、同様の単純なWebエージェントと比較して成功率を26.6ポイント(+161%)向上させました。
  • この設計は、オンラインフィードバックや検索戦略を使用せずに、WebタスクにおけるLLMのzero-shotパフォーマンスを示しています。

本研究は、現実世界のエコシステムで一般化するために、LLMベースのエージェントの観測空間と行動空間を慎重に調整することが極めて重要であることを強調しています。