Menyusul rilis Deep Research oleh OpenAI, sebuah tim mereproduksi kerangka kerja agentic-nya dalam 24 jam dan membuka sumber implementasinya melalui pustaka smolagents. Sistem yang dihasilkan mengintegrasikan LLM dengan alat untuk penelusuran web dan inspeksi teks guna menyelesaikan tugas penalaran multi-langkah.

  • Reproduksinya memanfaatkan arsitektur "agen kode", memungkinkan model mengekspresikan tindakan sebagai kode alih-alih JSON, yang mengurangi penggunaan token dan meningkatkan penanganan status.
  • Pada set validasi GAIA, sistem sumber terbuka mencapai 55,15%, melampaui state-of-the-art sebelumnya sebesar 46% yang dipegang oleh Magentic-One.
  • Performa ini jauh melampaui skor ~7% dari GPT-4 mandiri pada benchmark yang sama dan mendekati 67,36% yang dilaporkan oleh OpenAI.
  • Tim mencatat bahwa kesetaraan penuh dengan OpenAI akan memerlukan kemampuan interaksi browser yang lebih canggih di luar implementasi berbasis teks saat ini.

Para penulis menganggap hal ini signifikan karena menunjukkan bahwa kerangka kerja agentic sumber terbuka dapat secara dramatis meningkatkan performa LLM pada benchmark kompleks yang intensif pengetahuan tanpa bergantung pada model tertutup.