H2O.ai宣布其h2oGPTe Agent在通用AI助手(GAIA)基准测试中取得第1名,准确率达到75%。这一成绩首次使该模型在GAIA测试集上达到C级水平,并超越OpenAI的Deep Research,同时与Manus的性能持平。

  • 该Agent利用Anthropic的Claude 3.7 Sonnet的专业推理模式处理复杂的分析任务。
  • 新增功能包括高级浏览器导航、跨Google和Bing等多个搜索引擎的统一搜索,以及面向软件工程的GitHub集成。
  • H2O.ai强调其结果基于GAIA测试集而非验证集,并指出后者可能存在数据污染问题。
  • 该平台现已支持实时来源归属和内联回复引用,以增强透明度。

这一成就验证了H2O.ai在构建能够处理需要推理、多模态和工具使用的现实世界任务的AI助手方面的方法。