Benchmark · agentic

OSWorld

28 परिणाम 22 मॉडल

OSWorld एक बेंचमार्क है जो कंप्यूटर-उपयोग करने वाले एजेंट्स को असली डेस्कटॉप ऑपरेटिंग सिस्टम के कार्यों पर परखता है, जो रोज़मर्रा के ऐप्स (फ़ाइल मैनेजर, वेब ब्राउज़र, ऑफ़िस सूट) में फैले होते हैं। यह उन कार्यों का प्रतिशत बताता है जिन्हें एजेंट सफलतापूर्वक पूरा करता है।

और पढ़ें
उदाहरण
किसी कार्य में एजेंट से कहा जा सकता है कि वह एक स्प्रेडशीट खोले, कोई मान बदले या डेटा को दोबारा फ़ॉर्मैट करे और फ़ाइल सहेजे — या फ़ाइल मैनेजर में कोई फ़ाइल ढूँढे और सिस्टम सेटिंग बदले — असली ग्राफ़िकल इंटरफ़ेस (GUI) को वैसे ही चलाते हुए जैसे कोई व्यक्ति चलाता है।
स्कोरिंग
मापदंड है कार्य सफलता दर (task success rate), जिसे प्रतिशत में व्यक्त किया जाता है। हर कार्य या तो पास होता है या फेल, और स्कोर पूरे सेट में पास किए गए कार्यों का अनुपात होता है।
सत्यापन
परिणामों की जाँच स्वचालित रूप से निष्पादन-आधारित स्क्रिप्ट्स द्वारा की जाती है जो मशीन की अंतिम स्थिति की जाँच करती हैं (जैसे, क्या सही फ़ाइल, मान या सेटिंग अब मौजूद है), न कि टेक्स्ट मिलान या मानव मतदान द्वारा।
यह क्यों मायने रखता है
यह मापता है कि क्या AI एजेंट कई ऐप्स में असली कंप्यूटर को वास्तव में चला सकते हैं — यह प्रश्नों के उत्तर देने या एकल-ऐप कार्यों की तुलना में स्वायत्तता की कहीं अधिक कठिन और यथार्थवादी परीक्षा है।
हल किया गया उदाहरण
कार्य
Ubuntu डेस्कटॉप पर एक GNOME Terminal खुला है। फ़ोल्डर ~/project में 10 MB से बड़ी सभी .log फ़ाइलें रिकर्सिव तरीके से खोजें और उन्हें हटा दें, बाकी सभी फ़ाइलों को अछूता छोड़ते हुए।
समाधान
find ~/project -type f -name '*.log' -size +10M -delete
व्याख्या
find ~/project को रिकर्सिव रूप से देखता है, *.log नाम वाली 10 MB से बड़ी सामान्य फ़ाइलों को चुनता है, और -delete ठीक उन्हीं को हटाता है, बाकी सब को छोड़ देता है। OSWorld हर टास्क के अपने चेकर से वर्चुअल मशीन (VM) की अंतिम फ़ाइल-सिस्टम स्थिति जाँचता है और reward 1 तभी देता है जब लक्षित logs हट गए हों और अन्य फ़ाइलें बनी रहें।
0 24 48 72 96 2024-04-11 2025-06-11 2026-08-11 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27 Muse Glimmer · 65.9 · 2026-08-10 Opus 5 · 90.7 · 2026-08-11
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI Muse Glimmer Opus 5
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-11 Opus 5 90.69% ओरोबोरस स्व-विकासित एजेंट ने Opus 5 के साथ नए बेंचमार्क स्थापित किए
2026-08-10 Muse Glimmer 65.9% मेटा ने म्यूज़ ग्लिमर जारी किया, एक 30B ओपन-वेइट्स एजेंटिक मॉडल जो एक उपभोक्ता GPU पर चलता है
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL किसी भी वातावरण में हार्नेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL किसी भी वातावरण में हैर्नेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL किसी भी वातावरण में हैरनेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है
2026-07-21 Gemini 3.5 Flash-Lite 74.0% एजेंटिक लोड के लिए Google ने Gemini 3.6 Flash, 3.5 Flash-Lite और 3.5 Flash Cyber जारी किए
2026-07-21 Gemini 3.6 Flash 83.0% एजेंटिक लोड के लिए Google ने Gemini 3.6 Flash, 3.5 Flash-Lite और 3.5 Flash Cyber जारी किए
2026-07-21 Gemini 3.6 Flash 83.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-21 Gemini 3.5 Flash-Lite 74.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-09 GPT-5.6 Sol 62.6% OpenAI ने Sol, Terra और Luna मॉडलों के साथ GPT-5.6 परिवार लॉन्च किया
2026-07-06 OpenCUA-72B 48.9% असफलता से सीखना: कंप्यूटर-यूज़ एजेंट्स के लिए इन्फरेंस-टाइम स्वयं-सुधार
2026-04-25 GPT-5.5 78.7% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 बहु-प्लेटफ़ॉर्म मौलिक GUI एजेंट्स को पेश करता है
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic ने कोडिंग, कंप्यूटर उपयोग और 1M टोकन संदर्भ में सुधार के साथ Claude Sonnet 4.6 जारी किया
2026-02-05 Claude Opus 4.6 72.7% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2025-10-22 Surfer 2 60.1% Surfer 2 दृश्य अवलोकन के माध्यम से क्रॉस-प्लेटफ़ॉर्म कंप्यूटर उपयोग में राज्य-कला प्राप्त करता है
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic ने कोडिंग, कंप्यूटर उपयोग और एलाइनमेंट में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 बहु-चक्र प्रबलता सीखने के साथ GUI एजेंट को आगे बढ़ाता है
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 ने GUI-Owl पेश किया, AndroidWorld और OSWorld पर नया ओपन-सोर्स SOTA स्थापित किया
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 ने GUI-Owl पेश किया, AndroidWorld और OSWorld पर नया ओपन-सोर्स SOTA स्थापित किया
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 ने GUI-Owl पेश किया, AndroidWorld और OSWorld पर नया ओपन-सोर्स SOTA स्थापित किया
2025-01-23 CUA 38.1% OpenAI ने कंप्यूटर-यूजिंग एजेंट (CUA) द्वारा संचालित ऑपरेटर शोध पूर्वावलोकन का परिचय दिया
2025-01-21 UI-TARS 24.6% UI-TARS ने व्यापारिक फ्रेमवर्कों को पछाड़ने वाला स्थानीय GUI एजेंट मॉडल पेश किया
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic ने क्लॉड 3.5 हाइकु और कंप्यूटर उपयोग के साथ अपग्रेडेड क्लॉड 3.5 सॉनेट को जारी किया
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
2024-04-11 best model 12.24% OSWorld ने वास्तविक कंप्यूटर वातावरण में बहुआयामी एजेंट्स के लिए बेंचमार्क पेश किया