H2O.ai는 자체 h2oGPTe 에이전트가 일반 AI 어시스턴트(GAIA) 벤치마크에서 1위를 달성하여 75%의 정확도를 달성했다고 발표했습니다. 이 결과는 GAIA 테스트 세트에서 C 등급이 최초로 달성되었음을 의미하며, OpenAI의 Deep Research를 앞서 Manus의 성능과 동률을 이루고 있습니다.

  • 에이전트는 복잡한 분석 작업을 위해 Anthropic의 Claude 3.7 Sonnet을 전문 추론 모드로 활용합니다.
  • 새로운 기능에는 정교한 브라우저 탐색, Google 및 Bing 등 여러 엔진에 대한 통합 검색, 소프트웨어 엔지니어링을 위한 GitHub 통합이 포함됩니다.
  • H2O.ai는 검증 세트에서 잠재적인 데이터 오염 가능성을 지적하며, 결과가 검증 세트가 아닌 GAIA 테스트 세트를 기반으로 한다고 강조했습니다.
  • 플랫폼은 투명성을 높이기 위해 실시간 소스 출처 및 인라인 응답 인용 기능을 제공합니다.

이번 성과는 추론, 다중 모달리티, 도구 사용이 필요한 실제 작업을 처리할 수 있는 AI 어시스턴트 생성을 위한 H2O.ai의 접근 방식을 입증합니다.