H2O.ai mengumumkan bahwa agen h2oGPTe-nya telah mencapai posisi #1 pada benchmark General AI Assistants (GAIA), dengan tingkat akurasi 75%. Hasil ini menandai pertama kalinya nilai C berhasil dicapai pada set uji GAIA dan menempatkan agen tersebut di atas Deep Research dari OpenAI serta menyamai kinerja Manus.

  • Agen ini memanfaatkan Claude 3.7 Sonnet dari Anthropic dengan mode penalaran khusus untuk tugas analitis yang kompleks.
  • Kemampuan baru mencakup navigasi browser yang canggih, pencarian terpadu di berbagai mesin seperti Google dan Bing, serta integrasi GitHub untuk rekayasa perangkat lunak.
  • H2O.ai menekankan bahwa hasilnya didasarkan pada set uji GAIA, bukan set validasi, dengan mengutip potensi kontaminasi data pada yang terakhir.
  • Platform ini kini dilengkapi dengan atribusi sumber langsung dan kutipan respons inline untuk meningkatkan transparansi.

Pencapaian ini memvalidasi pendekatan H2O.ai dalam membuat asisten AI yang mampu menangani tugas dunia nyata yang memerlukan penalaran, multimodalitas, dan penggunaan alat.