Benchmark · agentic

WebArena

9 resultados 9 modelos

WebArena comprueba si un agente web autónomo puede completar tareas reales de varios pasos en un conjunto de sitios web realistas y autoalojados: tienda online, un foro y un gestor de contenidos (CMS). Su métrica es la task success rate (tasa de éxito de tareas): el porcentaje de tareas que el agente termina correctamente.

Leer más
Ejemplo
Una tarea representativa: «encontrar el producto más barato de una categoría y añadir dos al carrito», que el agente debe lograr navegando, haciendo clic y escribiendo en el sitio real.
Puntuación
La métrica es la tasa de éxito de tareas: tareas completadas divididas entre el total de tareas, expresado como porcentaje.
Verificación
Cada tarea incluye un verificador programático que comprueba el resultado automáticamente, ya sea comparando con la respuesta esperada o inspeccionando el estado final del sitio, de modo que la evaluación la hace la máquina y no una persona.
Por qué importa
Muestra si los agentes LLM pueden operar de verdad sitios web reales de principio a fin —una prueba más difícil y práctica que las tareas web de un solo paso o sintéticas—, lo que lo convierte en un referente clave para la automatización web con agentes.
Ejemplo resuelto
Tarea
Eres un agente web autónomo en el entorno GitLab autoalojado de WebArena: observas el árbol de accesibilidad (accessibility tree) de la página y, en cada paso, emites una acción del espacio de acciones de WebArena (por ejemplo, click [id], type [id] [text] [enter], goto [url], stop [answer]). Objetivo: crear una nueva issue titulada Bug: login button unresponsive en el repositorio a11yproject/a11yproject.com y asignártela a ti mismo.
Solución
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
Explicación
La trayectoria abre el formulario de nueva issue, escribe el título exacto, se autoasigna mediante el menú de responsable y envía; stop [N/A] termina el episodio porque la tarea modifica el estado en vez de devolver un valor. El evaluador program_html de WebArena recarga la issue creada y comprueba el DOM de forma funcional —el título coincide con la cadena y el responsable es el usuario conectado—, de modo que las coincidencias aproximadas obtienen 0.
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
Cronología
Fecha Modelo Puntuación Fuente
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent establece el estado del arte en pruebas de uso móvil
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 introduce agentes fundamentales de GUI multiplataforma
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent introduce la evolución adaptativa del conocimiento para una automatización web robusta a largo plazo
2025-10-22 Surfer 2 69.6% Surfer 2 alcanza el estado del arte en el uso de computadoras multiplataforma mediante observación visual
2025-01-23 CUA 58.1% OpenAI presenta el Agente de Uso de Computadora (CUA) que impulsa la vista previa de investigación de Operator
2024-10-17 AgentOccam 9.8% AgentOccam alinea los espacios de observación y acción para mejorar el rendimiento de agentes web basados en LLM
2024-08-08 AWA 1.5 57.14% AWA 1.5 alcanza el 57,14% en la prueba de referencia WebArena
2023-10-05 SteP 33.5% SteP utiliza políticas de LLM apiladas para mejorar el rendimiento en tareas web
2023-07-25 GPT-4-based agent 14.41% WebArena: entorno web realista para agentes autónomos