Benchmark · agentic
OSWorld 2.0
2026 long-horizon re-cut of OSWorld: 108 multi-app desktop workflows, median human task ~1.6h. Not on the same scale as OSWorld / OSWorld-Verified — file here only when the quote says 2.0.
| Data | Modelo | Pontuação | Fonte |
|---|---|---|---|
| 2026-09-05 | GPT‑6 Astra | 72.6% | OpenAI lança GPT-6 Astra com melhorias em uso de computador, programação e cibersegurança |
| 2026-09-04 | GPT-6 Astra | 72.6% | OpenAI lança GPT-6 Astra, um modelo de uso computacional com contexto de 1,05M |
| 2026-09-04 | Muse Spark 1.3 | 66.9% | Meta lança Muse Spark 1.3 com menos chamadas de ferramentas e tokens |
| 2026-09-01 | Claude Fable 5.1 | 41.7% | Anthropic lança Claude Fable 5.1 com 52,6% no Terminal-Bench-Science e leituras de cache mais baratas |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen lança Qwen-CUA, um agente nativo de uso do computador com 397B-A17B |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen lança Qwen-CUA, um agente nativo de uso do computador com 397B-A17B |
| 2026-08-04 | Qwen-CUA | 18.5% | Qwen lança o Qwen-CUA, um agente nativo de uso do computador com 397B-A17B |
| 2026-08-04 | Qwen-CUA-Max | 21.2% | Qwen lança o Qwen-CUA, um agente nativo de uso do computador com 397B-A17B |
| 2026-07-28 | Claude Opus 5 | 70.0% | Anthropic lança Claude Opus 5 como alternativa econômica ao Fable |