Los investigadores presentan AgentOccam, una línea base para agentes web basados en LLM que mejora el rendimiento refinando el espacio de observación y acción para alinearse mejor con los datos de preentrenamiento del modelo. Este enfoque elimina la necesidad de estrategias manuales como ejemplos in-context o sistemas multi-agente.

  • En el benchmark WebArena, AgentOccam supera a los métodos state-of-the-art anteriores en 9.8 puntos absolutos (+29.4%) y al trabajo concurrente en 5.9 puntos absolutos (+15.8%).
  • El método aumenta las tasas de éxito en 26.6 puntos (+161%) en comparación con agentes web simples similares.
  • El diseño destaca el rendimiento zero-shot de los LLM en tareas web sin utilizar retroalimentación online ni estrategias de búsqueda.

El estudio subraya el papel crítico de ajustar cuidadosamente los espacios de observación y acción para agentes basados en LLM que generalicen en escenarios del mundo real.