Benchmark · agentic

OSWorld

28 hasil 22 model

OSWorld adalah benchmark yang menguji agen pengguna komputer pada tugas-tugas nyata sistem operasi desktop yang mencakup aplikasi sehari-hari (pengelola berkas, peramban web, suite perkantoran). Benchmark ini melaporkan persentase tugas yang berhasil diselesaikan agen.

Selengkapnya
Contoh
Sebuah tugas dapat meminta agen membuka lembar kerja, mengubah suatu nilai atau memformat ulang data dan menyimpan berkas, atau menemukan berkas di pengelola berkas dan mengubah pengaturan sistem, dengan mengoperasikan antarmuka grafis (GUI) nyata seperti yang dilakukan manusia.
Penilaian
Metriknya adalah tingkat keberhasilan tugas (task success rate), yang dinyatakan dalam persen. Setiap tugas berhasil atau gagal, dan skornya adalah proporsi tugas yang lulus di seluruh kumpulan tugas.
Verifikasi
Hasil diperiksa secara otomatis oleh skrip berbasis eksekusi yang memeriksa keadaan akhir mesin (misalnya, apakah berkas, nilai, atau pengaturan yang benar kini ada), bukan dengan mencocokkan teks atau pemungutan suara manusia.
Mengapa penting
Benchmark ini mengukur apakah agen AI benar-benar dapat mengoperasikan komputer nyata di berbagai aplikasi — ujian otonomi yang jauh lebih sulit dan realistis daripada menjawab pertanyaan atau tugas satu aplikasi.
Contoh penyelesaian
Tugas
Sebuah GNOME Terminal terbuka di desktop Ubuntu. Di folder ~/project, cari secara rekursif semua file .log yang lebih besar dari 10 MB lalu hapus, dengan membiarkan semua file lain tetap utuh.
Solusi
find ~/project -type f -name '*.log' -size +10M -delete
Penjelasan
find menelusuri ~/project secara rekursif, memilih file biasa bernama *.log yang lebih besar dari 10 MB, dan -delete menghapus tepat file-file itu tanpa menyentuh yang lain. OSWorld menilai dengan pemeriksa khusus per tugas atas kondisi akhir sistem file mesin virtual (VM), dan memberi reward 1 hanya jika logs target hilang dan file lain tetap ada.
0 24 48 72 96 2024-04-11 2025-06-11 2026-08-11 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27 Muse Glimmer · 65.9 · 2026-08-10 Opus 5 · 90.7 · 2026-08-11
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI Muse Glimmer Opus 5
Linimasa
Tanggal Model Skor Sumber
2026-08-11 Opus 5 90.69% Agen Ouroboros yang berkembang sendiri menetapkan tolok ukur baru dengan Opus 5
2026-08-10 Muse Glimmer 65.9% Meta merilis Muse Glimmer, model agen berbobot terbuka 30B yang berjalan pada satu GPU konsumen
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber untuk beban kerja agentic
2026-07-21 Gemini 3.6 Flash 83.0% Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber untuk beban kerja agentic
2026-07-21 Gemini 3.6 Flash 83.0% Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google merilis Gemini 3.6 Flash, 3.5 Flash-Lite, dan 3.5 Flash Cyber
2026-07-09 GPT-5.6 Sol 62.6% OpenAI meluncurkan keluarga GPT-5.6 dengan model Sol, Terra, dan Luna
2026-07-06 OpenCUA-72B 48.9% Belajar dari Kegagalan: Peningkatan Diri Saat Inferensi untuk Agen Penggunaan Komputer
2026-04-25 GPT-5.5 78.7% OpenAI merilis GPT-5.5, model yang dilatih ulang dari awal dengan pemrosesan omnimodal asli
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 memperkenalkan agen GUI fundamental multi-platform
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic merilis Claude Sonnet 4.6 dengan peningkatan coding, penggunaan komputer, dan konteks 1M token
2026-02-05 Claude Opus 4.6 72.7% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2025-10-22 Surfer 2 60.1% Surfer 2 mencapai penggunaan komputer lintas platform terbaik melalui pengamatan visual
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic merilis Claude Sonnet 4.5 dengan kemampuan coding dan agen yang ditingkatkan
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic merilis Claude Sonnet 4.5 dengan peningkatan coding, penggunaan komputer, dan alignment
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 memajukan agen GUI dengan pembelajaran penguatan multi-giliran
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 memperkenalkan GUI-Owl, menetapkan SOTA open-source baru di AndroidWorld dan OSWorld
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 memperkenalkan GUI-Owl, menetapkan SOTA open-source baru di AndroidWorld dan OSWorld
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 memperkenalkan GUI-Owl, menetapkan SOTA open-source baru di AndroidWorld dan OSWorld
2025-01-23 CUA 38.1% OpenAI memperkenalkan Agen Pengguna Komputer (CUA) yang mendukung pratinjau riset Operator
2025-01-21 UI-TARS 24.6% UI-TARS memperkenalkan model agen GUI asli yang mengungguli kerangka kerja komersial
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic merilis Claude 3.5 Haiku dan Claude 3.5 Sonnet yang ditingkatkan dengan kemampuan penggunaan komputer
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic meningkatkan Claude 3.5 Sonnet, merilis Claude 3.5 Haiku dan beta penggunaan komputer
2024-04-11 best model 12.24% OSWorld memperkenalkan benchmark untuk agen multimodal di lingkungan komputer nyata