Benchmark · agentic
OSWorld
OSWorld es un benchmark que evalúa a los agentes de uso de computadora en tareas reales de un sistema operativo de escritorio que abarcan aplicaciones cotidianas (gestores de archivos, navegadores web, suites de oficina). Informa el porcentaje de tareas que el agente completa con éxito.
Leer más
- Ejemplo
- Una tarea podría pedir al agente que abra una hoja de cálculo, edite un valor o reformatee datos y guarde el archivo, o que busque un archivo en el gestor de archivos y cambie un ajuste del sistema, operando la interfaz gráfica (GUI) real igual que lo haría una persona.
- Puntuación
- La métrica es la tasa de éxito de tareas (task success rate), expresada como porcentaje. Cada tarea se aprueba o se falla, y la puntuación es la fracción de tareas superadas en todo el conjunto.
- Verificación
- Los resultados se comprueban automáticamente mediante scripts basados en ejecución que inspeccionan el estado final de la máquina (por ejemplo, si ahora existe el archivo, el valor o el ajuste correcto), en lugar de comparar texto o votos humanos.
- Por qué importa
- Mide si los agentes de IA pueden realmente operar una computadora real a través de muchas aplicaciones, una prueba de autonomía mucho más difícil y realista que responder preguntas o tareas de una sola aplicación.
Ejemplo resuelto
Tarea
En el escritorio de Ubuntu hay un GNOME Terminal abierto. En la carpeta ~/project, busca de forma recursiva todos los archivos .log de más de 10 MB y elimínalos, dejando intactos los demás archivos.
Solución
find ~/project -type f -name '*.log' -size +10M -delete
Explicación
find recorre ~/project de forma recursiva, selecciona los archivos normales llamados *.log de más de 10 MB y -delete borra exactamente esos, sin tocar el resto. OSWorld califica con un verificador propio de cada tarea sobre el estado final del sistema de archivos de la máquina virtual (VM) y otorga reward 1 solo si los logs objetivo desaparecieron y los demás archivos permanecen.