Peneliti memperkenalkan OSWorld, lingkungan komputer nyata yang dapat diskalakan pertama yang dirancang untuk mengevaluasi agen multimodal pada tugas terbuka di Ubuntu, Windows, dan macOS.
- Benchmark ini mencakup 369 tugas komputer yang berasal dari kasus penggunaan dunia nyata yang melibatkan aplikasi web dan desktop, I/O file, dan alur kerja multi-aplikasi.
- Setiap tugas memiliki pengaturan keadaan awal yang terperinci dan skrip evaluasi berbasis eksekusi kustom untuk penilaian yang andal.
- Evaluasi agen LLM/VLM mutakhir menunjukkan defisit signifikan, dengan model terbaik hanya mencapai keberhasilan 12,24% dibandingkan kinerja manusia lebih dari 72,36%.
- Kesulitan utama yang diidentifikasi adalah grounding GUI dan pengetahuan operasional.
Benchmark ini menyediakan lingkungan terpadu untuk mengevaluasi skalabilitas agen dan memberikan wawasan untuk mengembangkan agen generalis multimodal yang tidak dapat didukung oleh benchmark sebelumnya.