Benchmark · agentic
OSWorld 2.0
2026 long-horizon re-cut of OSWorld: 108 multi-app desktop workflows, median human task ~1.6h. Not on the same scale as OSWorld / OSWorld-Verified — file here only when the quote says 2.0.
| Fecha | Modelo | Puntuación | Fuente |
|---|---|---|---|
| 2026-09-05 | GPT‑6 Astra | 72.6% | OpenAI lanza GPT-6 Astra con capacidades mejoradas de uso del ordenador, programación y ciberseguridad |
| 2026-09-04 | GPT-6 Astra | 72.6% | OpenAI lanza GPT-6 Astra, un modelo de uso informático con contexto de 1.05M |
| 2026-09-04 | Muse Spark 1.3 | 66.9% | Meta lanza Muse Spark 1.3 con menos llamadas a herramientas y tokens |
| 2026-09-01 | Claude Fable 5.1 | 41.7% | Anthropic lanza Claude Fable 5.1 con 52,6% en Terminal-Bench-Science y lecturas de caché más baratas |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen lanza Qwen-CUA, un agente de uso nativo del ordenador de 397B-A17B |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen lanza Qwen-CUA, un agente de uso nativo del ordenador de 397B-A17B |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen lanza Qwen-CUA, un agente nativo de uso informático de 397B-A17B |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen lanza Qwen-CUA, un agente nativo de uso informático de 397B-A17B |
| 2026-07-28 | Claude Opus 5 | 70.0% | Anthropic lanza Claude Opus 5 como alternativa rentable a Fable |