Les chercheurs présentent AgentOccam, une ligne de base pour les agents web basés sur les LLM qui améliore les performances en affinant l'espace d'observation et d'action pour mieux s'aligner sur les données de pré-entraînement du modèle. Cette approche élimine le besoin de stratégies artisanales comme des exemples in-context ou des systèmes multi-agents.

  • Sur le benchmark WebArena, AgentOccam dépasse les méthodes state-of-the-art précédentes de 9.8 points absolus (+29.4%) et le travail concurrent de 5.9 points absolus (+15.8%).
  • La méthode augmente les taux de succès de 26.6 points (+161%) par rapport aux agents web simples similaires.
  • La conception met en évidence la performance zero-shot des LLM sur les tâches web sans utiliser de feedback en ligne ni de stratégies de recherche.

L'étude souligne le rôle critique du réglage minutieux des espaces d'observation et d'action pour que les agents basés sur les LLM généralisent dans des scénarios du monde réel.