Benchmark · agentic
OSWorld 2.0
2026 long-horizon re-cut of OSWorld: 108 multi-app desktop workflows, median human task ~1.6h. Not on the same scale as OSWorld / OSWorld-Verified — file here only when the quote says 2.0.
| Date | Model | Score | Source |
|---|---|---|---|
| 2026-09-05 | GPT‑6 Astra | 72.6% | OpenAI releases GPT-6 Astra with improved computer use, coding, and cybersecurity capabilities |
| 2026-09-04 | GPT-6 Astra | 72.6% | OpenAI releases GPT-6 Astra, a computer-use model with 1.05M context |
| 2026-09-04 | Muse Spark 1.3 | 66.9% | Meta releases Muse Spark 1.3 with fewer tool calls and tokens |
| 2026-09-01 | Claude Fable 5.1 | 41.7% | Anthropic releases Claude Fable 5.1 with 52.6% on Terminal-Bench-Science and cheaper cache reads |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen releases Qwen-CUA, a 397B-A17B native computer-use agent |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen releases Qwen-CUA, a 397B-A17B native computer-use agent |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen releases Qwen-CUA, a 397B-A17B native computer-use agent |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen releases Qwen-CUA, a 397B-A17B native computer-use agent |
| 2026-07-28 | Claude Opus 5 | 70.0% | Anthropic releases Claude Opus 5 as a cost-effective alternative to Fable |