Benchmark · agentic
OSWorld 2.0
2026 long-horizon re-cut of OSWorld: 108 multi-app desktop workflows, median human task ~1.6h. Not on the same scale as OSWorld / OSWorld-Verified — file here only when the quote says 2.0.
| Tanggal | Model | Skor | Sumber |
|---|---|---|---|
| 2026-09-05 | GPT‑6 Astra | 72.6% | OpenAI merilis GPT-6 Astra dengan kemampuan penggunaan komputer, pemrograman, dan keamanan siber yang lebih baik |
| 2026-09-04 | GPT-6 Astra | 72.6% | OpenAI merilis GPT-6 Astra, model penggunaan komputer dengan konteks 1,05 juta |
| 2026-09-04 | Muse Spark 1.3 | 66.9% | Meta merilis Muse Spark 1.3 dengan lebih sedikit panggilan alat dan token |
| 2026-09-01 | Claude Fable 5.1 | 41.7% | Anthropic merilis Claude Fable 5.1 dengan skor 52,6% di Terminal-Bench-Science dan bacaan cache yang lebih murah |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen merilis Qwen-CUA, agen penggunaan komputer asli 397B-A17B |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen merilis Qwen-CUA, agen penggunaan komputer asli 397B-A17B |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen merilis Qwen-CUA, agen penggunaan komputer asli 397B-A17B |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen merilis Qwen-CUA, agen penggunaan komputer asli 397B-A17B |
| 2026-07-28 | Claude Opus 5 | 70.0% | Anthropic merilis Claude Opus 5 sebagai alternatif hemat biaya untuk Fable |