Pesquisadores introduzem o AgentOccam, uma linha de base para agentes web baseados em LLM que melhora o desempenho ao refinar o espaço de observação e ação para melhor alinhamento com os dados de pré-treinamento do modelo. Esta abordagem elimina a necessidade de estratégias artesanais como exemplos in-context ou sistemas multi-agente.
- No benchmark WebArena, o AgentOccam supera métodos state-of-the-art anteriores em 9.8 pontos absolutos (+29.4%) e trabalhos concorrentes em 5.9 pontos absolutos (+15.8%).
- O método aumenta as taxas de sucesso em 26.6 pontos (+161%) em comparação com agentes web simples similares.
- O design destaca o desempenho zero-shot dos LLMs em tarefas web sem usar feedback online ou estratégias de busca.
O estudo ressalta o papel crítico de ajustar cuidadosamente os espaços de observação e ação para agentes baseados em LLM generalizarem em cenários do mundo real.