Para peneliti telah memperkenalkan WebArena, sebuah lingkungan yang sangat realistis dan dapat direproduksi yang dirancang untuk membangun dan menguji agen otonom yang dipandu bahasa. Berbeda dengan pengaturan sintetis sebelumnya, platform ini menawarkan situs web yang sepenuhnya fungsional di empat domain umum: e-commerce, forum sosial, pengembangan perangkat lunak kolaboratif, dan manajemen konten.

  • Lingkungan ini mencakup alat seperti peta dan basis pengetahuan eksternal untuk mendorong penyelesaian tugas yang mirip manusia.
  • Sebuah benchmark tugas jangka panjang yang beragam dirilis untuk mengevaluasi kebenaran fungsional dari penyelesaian agen.
  • Eksperimen dasar menunjukkan bahwa agen berbasis GPT-4 terbaik hanya mencapai tingkat keberhasilan tugas end-to-end sebesar 14,41%.
  • Kinerja ini secara signifikan lebih rendah daripada kinerja manusia, yang berada di angka 78,24%.

Hasil-hasil ini menyoroti bahwa model bahasa besar terkini jauh dari sempurna dalam tugas kehidupan nyata dan menunjukkan utilitas WebArena untuk mengukur kemajuan di masa depan.