研究者らは、Ubuntu、Windows、macOSでのオープンエンドタスクにおいてマルチモーダルエージェントを評価するために設計された、スケーラブルで現実的なコンピュータ環境であるOSWorldを紹介します。

  • ベンチマークには、Webおよびデスクトップアプリ、ファイルI/O、マルチアプリケーションワークフローを含む現実世界のユースケースから派生した369のコンピュータタスクが含まれています。
  • 各タスクには、詳細な初期状態の設定と信頼性の高い評価のためのカスタム実行ベースの評価スクリプトが用意されています。
  • 最先端のLLM/VLMベースエージェントの評価では重大な欠陥が示され、最良のモデルでも成功率は12.24%にとどまり、人間の性能72.36%と比較して大幅に劣っています。
  • 特定された主な困難はGUIグラウンディングと運用知識です。

このベンチマークはエージェントのスケーラビリティを評価するための統合環境を提供し、以前のベンチマークではサポートできなかったマルチモーダルジェネラリストエージェントの開発に関する洞察を提供します。