Los investigadores han presentado WebArena, un entorno altamente realista y reproducible diseñado para construir y probar agentes autónomos guiados por lenguaje. A diferencia de los entornos sintéticos anteriores, esta plataforma cuenta con sitios web completamente funcionales en cuatro dominios comunes: comercio electrónico, foros sociales, desarrollo colaborativo de software y gestión de contenido.
- El entorno incluye herramientas como mapas y bases de conocimiento externas para fomentar la resolución de tareas similar a la humana.
- Se ha publicado una prueba de referencia con tareas diversas y de largo alcance para evaluar la corrección funcional de las completaciones del agente.
- Los experimentos base muestran que el mejor agente basado en GPT-4 logra solo una tasa de éxito del 14.41% en tareas de extremo a extremo.
- Este rendimiento es significativamente menor que el rendimiento humano, que se sitúa en el 78.24%.
Los resultados destacan que los modelos de lenguaje grandes más avanzados actuales están lejos de ser perfectos en tareas de la vida real y demuestran la utilidad de WebArena para medir el progreso futuro.