Benchmark · agentic

OSWorld

29 परिणाम 23 मॉडल

OSWorld एक बेंचमार्क है जो कंप्यूटर-उपयोग करने वाले एजेंट्स को असली डेस्कटॉप ऑपरेटिंग सिस्टम के कार्यों पर परखता है, जो रोज़मर्रा के ऐप्स (फ़ाइल मैनेजर, वेब ब्राउज़र, ऑफ़िस सूट) में फैले होते हैं। यह उन कार्यों का प्रतिशत बताता है जिन्हें एजेंट सफलतापूर्वक पूरा करता है।

और पढ़ें
उदाहरण
किसी कार्य में एजेंट से कहा जा सकता है कि वह एक स्प्रेडशीट खोले, कोई मान बदले या डेटा को दोबारा फ़ॉर्मैट करे और फ़ाइल सहेजे — या फ़ाइल मैनेजर में कोई फ़ाइल ढूँढे और सिस्टम सेटिंग बदले — असली ग्राफ़िकल इंटरफ़ेस (GUI) को वैसे ही चलाते हुए जैसे कोई व्यक्ति चलाता है।
स्कोरिंग
मापदंड है कार्य सफलता दर (task success rate), जिसे प्रतिशत में व्यक्त किया जाता है। हर कार्य या तो पास होता है या फेल, और स्कोर पूरे सेट में पास किए गए कार्यों का अनुपात होता है।
सत्यापन
परिणामों की जाँच स्वचालित रूप से निष्पादन-आधारित स्क्रिप्ट्स द्वारा की जाती है जो मशीन की अंतिम स्थिति की जाँच करती हैं (जैसे, क्या सही फ़ाइल, मान या सेटिंग अब मौजूद है), न कि टेक्स्ट मिलान या मानव मतदान द्वारा।
यह क्यों मायने रखता है
यह मापता है कि क्या AI एजेंट कई ऐप्स में असली कंप्यूटर को वास्तव में चला सकते हैं — यह प्रश्नों के उत्तर देने या एकल-ऐप कार्यों की तुलना में स्वायत्तता की कहीं अधिक कठिन और यथार्थवादी परीक्षा है।
हल किया गया उदाहरण
कार्य
Ubuntu डेस्कटॉप पर एक GNOME Terminal खुला है। फ़ोल्डर ~/project में 10 MB से बड़ी सभी .log फ़ाइलें रिकर्सिव तरीके से खोजें और उन्हें हटा दें, बाकी सभी फ़ाइलों को अछूता छोड़ते हुए।
समाधान
find ~/project -type f -name '*.log' -size +10M -delete
व्याख्या
find ~/project को रिकर्सिव रूप से देखता है, *.log नाम वाली 10 MB से बड़ी सामान्य फ़ाइलों को चुनता है, और -delete ठीक उन्हीं को हटाता है, बाकी सब को छोड़ देता है। OSWorld हर टास्क के अपने चेकर से वर्चुअल मशीन (VM) की अंतिम फ़ाइल-सिस्टम स्थिति जाँचता है और reward 1 तभी देता है जब लक्षित logs हट गए हों और अन्य फ़ाइलें बनी रहें।
0 24 48 72 96 2024-04-11 2025-07-05 2026-09-29 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27 Muse Glimmer · 65.9 · 2026-08-10 Opus 5 · 90.7 · 2026-08-11 Holotron4 Nano (Nemotron 3 Nano Omni) · 76.3 · 2026-09-29
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI Muse Glimmer Opus 5 Holotron4 Nano (Nemotron 3 Nano Omni)
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-29 Holotron4 Nano (Nemotron 3 Nano Omni) 76.3% H कंपनी ने डेस्कटॉप, वेब और मोबाइल के लिए Holo4 ओपन-वेट कंप्यूटर-यूज़ मॉडल जारी किए
2026-08-11 Opus 5 90.69% ओरोबोरस स्व-विकासित एजेंट ने Opus 5 के साथ नए बेंचमार्क स्थापित किए
2026-08-10 Muse Glimmer 65.9% मेटा ने म्यूज़ ग्लिमर जारी किया, एक 30B ओपन-वेइट्स एजेंटिक मॉडल जो एक उपभोक्ता GPU पर चलता है
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL किसी भी वातावरण में हार्नेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL किसी भी वातावरण में हैर्नेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL किसी भी वातावरण में हैरनेस-आधारित एजेंट्स के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है
2026-07-21 Gemini 3.5 Flash-Lite 74.0% एजेंटिक लोड के लिए Google ने Gemini 3.6 Flash, 3.5 Flash-Lite और 3.5 Flash Cyber जारी किए
2026-07-21 Gemini 3.6 Flash 83.0% एजेंटिक लोड के लिए Google ने Gemini 3.6 Flash, 3.5 Flash-Lite और 3.5 Flash Cyber जारी किए
2026-07-21 Gemini 3.6 Flash 83.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-21 Gemini 3.5 Flash-Lite 74.0% गूगल ने गेमिनी 3.6 फ्लैश, 3.5 फ्लैश-लाइट और 3.5 फ्लैश साइबर जारी किए
2026-07-09 GPT-5.6 Sol 62.6% OpenAI ने Sol, Terra और Luna मॉडलों के साथ GPT-5.6 परिवार लॉन्च किया
2026-07-06 OpenCUA-72B 48.9% असफलता से सीखना: कंप्यूटर-यूज़ एजेंट्स के लिए इन्फरेंस-टाइम स्वयं-सुधार
2026-04-25 GPT-5.5 78.7% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 बहु-प्लेटफ़ॉर्म मौलिक GUI एजेंट्स को पेश करता है
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic ने कोडिंग, कंप्यूटर उपयोग और 1M टोकन संदर्भ में सुधार के साथ Claude Sonnet 4.6 जारी किया
2026-02-05 Claude Opus 4.6 72.7% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2025-10-22 Surfer 2 60.1% Surfer 2 दृश्य अवलोकन के माध्यम से क्रॉस-प्लेटफ़ॉर्म कंप्यूटर उपयोग में राज्य-कला प्राप्त करता है
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic ने कोडिंग, कंप्यूटर उपयोग और एलाइनमेंट में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 बहु-चक्र प्रबलता सीखने के साथ GUI एजेंट को आगे बढ़ाता है
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 ने GUI-Owl पेश किया, AndroidWorld और OSWorld पर नया ओपन-सोर्स SOTA स्थापित किया
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 ने GUI-Owl पेश किया, AndroidWorld और OSWorld पर नया ओपन-सोर्स SOTA स्थापित किया
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 ने GUI-Owl पेश किया, AndroidWorld और OSWorld पर नया ओपन-सोर्स SOTA स्थापित किया
2025-01-23 CUA 38.1% OpenAI ने कंप्यूटर-यूजिंग एजेंट (CUA) द्वारा संचालित ऑपरेटर शोध पूर्वावलोकन का परिचय दिया
2025-01-21 UI-TARS 24.6% UI-TARS ने व्यापारिक फ्रेमवर्कों को पछाड़ने वाला स्थानीय GUI एजेंट मॉडल पेश किया
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic ने क्लॉड 3.5 हाइकु और कंप्यूटर उपयोग के साथ अपग्रेडेड क्लॉड 3.5 सॉनेट को जारी किया
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic ने Claude 3.5 Sonnet को अपग्रेड किया, Claude 3.5 Haiku और कंप्यूटर यूज़ बीटा जारी किया
2024-04-11 best model 12.24% OSWorld ने वास्तविक कंप्यूटर वातावरण में बहुआयामी एजेंट्स के लिए बेंचमार्क पेश किया