Benchmark · agentic

OSWorld

26 resultados 20 modelos

OSWorld es un benchmark que evalúa a los agentes de uso de computadora en tareas reales de un sistema operativo de escritorio que abarcan aplicaciones cotidianas (gestores de archivos, navegadores web, suites de oficina). Informa el porcentaje de tareas que el agente completa con éxito.

Leer más
Ejemplo
Una tarea podría pedir al agente que abra una hoja de cálculo, edite un valor o reformatee datos y guarde el archivo, o que busque un archivo en el gestor de archivos y cambie un ajuste del sistema, operando la interfaz gráfica (GUI) real igual que lo haría una persona.
Puntuación
La métrica es la tasa de éxito de tareas (task success rate), expresada como porcentaje. Cada tarea se aprueba o se falla, y la puntuación es la fracción de tareas superadas en todo el conjunto.
Verificación
Los resultados se comprueban automáticamente mediante scripts basados en ejecución que inspeccionan el estado final de la máquina (por ejemplo, si ahora existe el archivo, el valor o el ajuste correcto), en lugar de comparar texto o votos humanos.
Por qué importa
Mide si los agentes de IA pueden realmente operar una computadora real a través de muchas aplicaciones, una prueba de autonomía mucho más difícil y realista que responder preguntas o tareas de una sola aplicación.
Ejemplo resuelto
Tarea
En el escritorio de Ubuntu hay un GNOME Terminal abierto. En la carpeta ~/project, busca de forma recursiva todos los archivos .log de más de 10 MB y elimínalos, dejando intactos los demás archivos.
Solución
find ~/project -type f -name '*.log' -size +10M -delete
Explicación
find recorre ~/project de forma recursiva, selecciona los archivos normales llamados *.log de más de 10 MB y -delete borra exactamente esos, sin tocar el resto. OSWorld califica con un verificador propio de cada tarea sobre el estado final del sistema de archivos de la máquina virtual (VM) y otorga reward 1 solo si los logs objetivo desaparecieron y los demás archivos permanecen.
0 22 44 66 88 2024-04-11 2025-06-03 2026-07-27 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI
Cronología
Fecha Modelo Puntuación Fuente
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno
2026-07-21 Gemini 3.6 Flash 83.0% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber para cargas de trabajo agénticas
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber para cargas de trabajo agénticas
2026-07-21 Gemini 3.6 Flash 83.0% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
2026-07-09 GPT-5.6 Sol 62.6% OpenAI lanza la familia GPT-5.6 con modelos Sol, Terra y Luna
2026-07-06 OpenCUA-72B 48.9% Aprendiendo del fracaso: auto-mejora en tiempo de inferencia para agentes de uso informático
2026-04-25 GPT-5.5 78.7% OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 introduce agentes fundamentales de GUI multiplataforma
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic lanza Claude Sonnet 4.6 con mejor codificación, uso de computadora y contexto de 1M de tokens
2026-02-05 Claude Opus 4.6 72.7% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2025-10-22 Surfer 2 60.1% Surfer 2 alcanza el estado del arte en el uso de computadoras multiplataforma mediante observación visual
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic lanza Claude Sonnet 4.5 con capacidades mejoradas de codificación y agentes
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic lanza Claude Sonnet 4.5 con mejoras en codificación, uso del ordenador y alineación
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 avanza en agentes de GUI con aprendizaje por refuerzo multironda
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 presenta GUI-Owl, estableciendo un nuevo SOTA de código abierto en AndroidWorld y OSWorld
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 presenta GUI-Owl, estableciendo un nuevo SOTA de código abierto en AndroidWorld y OSWorld
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 presenta GUI-Owl, estableciendo un nuevo SOTA de código abierto en AndroidWorld y OSWorld
2025-01-23 CUA 38.1% OpenAI presenta el Agente de Uso de Computadora (CUA) que impulsa la vista previa de investigación de Operator
2025-01-21 UI-TARS 24.6% UI-TARS presenta un modelo nativo de agente de GUI que supera a los marcos comerciales
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic lanza Claude 3.5 Haiku y actualiza Claude 3.5 Sonnet con uso de computadora
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic actualiza Claude 3.5 Sonnet, lanza Claude 3.5 Haiku y la versión beta de uso del ordenador
2024-04-11 best model 12.24% OSWorld presenta un benchmark para agentes multimodales en entornos informáticos reales