Benchmark · agentic
AgentBench
AgentBench evalúa a los LLM como agentes interactivos en 8 entornos distintos (tareas de código, de juego y de web), midiendo la toma de decisiones en múltiples turnos; cada entorno da una puntuación propia que se combinan en una única Overall Score ponderada.
Leer más
- Ejemplo
- Tarea del entorno «Sistema operativo»: se le da al agente un objetivo en lenguaje natural (por ejemplo, contar los archivos que cumplen una condición o cambiar los permisos de un archivo) y este introduce comandos bash ronda tras ronda, lee cada salida y luego envía una respuesta final o deja el shell en el estado requerido.
- Puntuación
- Cada entorno usa su propia métrica: tasa de éxito (OS, DB, House-Holding), F1 (grafo de conocimiento), recompensa media (Web Shopping), precisión de paso/elemento (navegación web) o progreso/recompensa de juego (juego de cartas, acertijos). La Overall Score principal es un promedio ponderado de las ocho puntuaciones, con pesos elegidos para equilibrar la dificultad de modo que ninguna tarea fácil domine.
- Verificación
- Cada tarea se ejecuta en un entorno ejecutable con un verificador automático y determinista: la trayectoria de varios turnos del agente se valida por programa (por ejemplo, un script que revisa el shell, el estado final de la base de datos, la recompensa de WebShop o la coincidencia con las acciones de referencia). No hay jueces humanos; las interacciones tienen un número máximo de rondas, y superar el límite o emitir una acción inválida cuenta como fallo.
- Por qué importa
- Fue uno de los primeros bancos de pruebas estandarizados en evaluar a los LLM como agentes y no como respondedores de un solo turno, ejercitando el razonamiento de largo horizonte, el uso de herramientas y la recuperación de errores; reveló una amplia brecha entre los mejores modelos comerciales de API y los modelos de código abierto en tareas agénticas reales.
Ejemplo resuelto
Tarea
Entorno «Sistema operativo». En un shell bash de Ubuntu, se le dice al agente: «¿Cuántas cuentas de usuario de este sistema tienen /bin/bash como shell de inicio de sesión? Da el número». Puede ejecutar varios comandos del shell durante varias rondas antes de responder.
Solución
grep -c ':/bin/bash$' /etc/passwd
Explicación
El séptimo campo (separado por dos puntos) de cada línea de /etc/passwd es el shell de inicio de sesión, así que contar las líneas que terminan en :/bin/bash da el número de cuentas con bash; el agente lee ese número de la salida del comando y lo devuelve mediante la acción
answer(N) del entorno. Calificación: el verificador de OS ejecuta un script de comprobación y puntúa el envío como éxito/fallo binario.Aún no hay puntuaciones verificadas para este benchmark.