Benchmark · agentic

OSWorld 2.0

9 परिणाम 7 मॉडल

2026 long-horizon re-cut of OSWorld: 108 multi-app desktop workflows, median human task ~1.6h. Not on the same scale as OSWorld / OSWorld-Verified — file here only when the quote says 2.0.

0 19.5 39 58.5 78 2026-07-28 2026-08-17 2026-09-05 Claude Opus 5 · 70 · 2026-07-28 Qwen-CUA · 18.5 · 2026-08-04 Qwen-CUA · 18.5 · 2026-08-04 Qwen-CUA-Max · 21.2 · 2026-08-04 Qwen-CUA-Max · 21.2 · 2026-08-04 Claude Fable 5.1 · 41.7 · 2026-09-01 Muse Spark 1.3 · 66.9 · 2026-09-04 GPT-6 Astra · 72.6 · 2026-09-04 GPT‑6 Astra · 72.6 · 2026-09-05
Claude Opus 5 Qwen-CUA Qwen-CUA-Max Claude Fable 5.1 Muse Spark 1.3 GPT-6 Astra GPT‑6 Astra
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-05 GPT‑6 Astra 72.6% OpenAI ने कंप्यूटर उपयोग, कोडिंग और साइबरसुरक्षा क्षमताओं में सुधार के साथ GPT-6 Astra जारी किया
2026-09-04 GPT-6 Astra 72.6% OpenAI ने GPT-6 Astra जारी किया, जो 1.05M संदर्भ के साथ एक कंप्यूटर-उपयोग मॉडल है
2026-09-04 Muse Spark 1.3 66.9% Meta ने Muse Spark 1.3 जारी किया है जिसमें कम टूल कॉल और टोकन हैं
2026-09-01 Claude Fable 5.1 41.7% Anthropic ने Claude Fable 5.1 को Terminal-Bench-Science पर 52.6% और सस्ते कैश रीड के साथ जारी किया
2026-08-04 Qwen-CUA 18.5% Qwen ने 397B-A17B नैटिव कंप्यूटर-यूज़ एजेंट Qwen-CUA जारी किया
2026-08-04 Qwen-CUA-Max 21.2% Qwen ने 397B-A17B नैटिव कंप्यूटर-यूज़ एजेंट Qwen-CUA जारी किया
2026-08-04 Qwen-CUA 18.5% Qwen ने Qwen-CUA जारी किया, एक 397B-A17B स्थानीय कंप्यूटर-उपयोग एजेंट
2026-08-04 Qwen-CUA-Max 21.2% Qwen ने Qwen-CUA जारी किया, एक 397B-A17B स्थानीय कंप्यूटर-उपयोग एजेंट
2026-07-28 Claude Opus 5 70.0% Anthropic ने Claude Opus 5 को Fable के लिए एक किफायती विकल्प के रूप में जारी किया