Los investigadores presentan AgentOccam, una línea base para agentes web basados en LLM que mejora el rendimiento refinando el espacio de observación y acción para alinearse mejor con los datos de preentrenamiento del modelo. Este enfoque elimina la necesidad de estrategias manuales como ejemplos in-context o sistemas multi-agente.
- En el benchmark WebArena, AgentOccam supera a los métodos state-of-the-art anteriores en 9.8 puntos absolutos (+29.4%) y al trabajo concurrente en 5.9 puntos absolutos (+15.8%).
- El método aumenta las tasas de éxito en 26.6 puntos (+161%) en comparación con agentes web simples similares.
- El diseño destaca el rendimiento zero-shot de los LLM en tareas web sin utilizar retroalimentación online ni estrategias de búsqueda.
El estudio subraya el papel crítico de ajustar cuidadosamente los espacios de observación y acción para agentes basados en LLM que generalicen en escenarios del mundo real.