H2O.aiは、そのh2oGPTe AgentがGeneral AI Assistants (GAIA) ベンチマークで1位を獲得し、75%の精度を達成したと発表した。この結果は、GAIAテストセットでCグレードが達成された初の事例であり、OpenAIのDeep Researchを上回り、Manusのパフォーマンスに匹敵するものである。

  • このエージェントは、複雑な分析タスクのためにAnthropicのClaude 3.7 Sonnetを専門的な推論モードで使用している。
  • 新しい機能には、高度なブラウザナビゲーション、GoogleやBingなどの複数のエンジンにわたる統合検索、およびソフトウェアエンジニアリングのためのGitHub統合が含まれる。
  • H2O.aiは、その結果が検証セットではなくGAIAテストセットに基づいていると強調し、前者における潜在的なデータ汚染を指摘している。
  • プラットフォームには、透明性を高めるためのライブソースの帰属情報とインラインでの回答引用機能が新たに搭載された。

この成果は、推論、マルチモーダル性、ツール使用を必要とする現実世界のタスクを処理できるAIアシスタントを作成するH2O.aiのアプローチを検証するものである。