H2O.ai는 자사의 엔터프라이즈 h2oGPTe 에이전트가 GAIA(General AI Assistants) 벤치마크 리더보드에서 65%의 점수로 최상위 위치를 달성했다고 발표했습니다. 이 결과는 Google의 Langfun Agent가 49%, Microsoft Research의 OpenAI o1 활용 사례가 38%인 등 다른 주요 제출 결과보다 현저히 우수한 성능입니다.
- Meta-FAIR, HuggingFace 등이 제작한 GAIA 벤치마크는 추론, 다중 모달리티 처리, 도구 사용이 필요한 실제 세계 작업을 466개의 질문을 통해 평가합니다.
- h2oGPTe는 복잡한 다중 에이전트 오케스트레이션 대신 Anthropic의 Sonnet 3.5, 프롬프트 캐싱, 최소한의 구조화를 활용한 간소화된 접근 방식으로 이 점수를 달성했습니다.
- 이 에이전트는 파운데이션 모델의 파인튜닝 없이 웹 브라우징, 코드 실행, 파일 처리, 데이터 사이언스 모델링을 위한 도구를 통합합니다.
- 이 성과는 비즈니스 워크플로우를 위해 여러 도구와 데이터 소스를 오케스트레이션할 수 있는 AI 에이전트로의 전환을 강조합니다.
이 성취는 H2O.ai가 엄격한 아키텍처 제약 없이 실용적인 작업을 지원할 수 있는 적응형이고 비용 효율적인 AI 시스템을 구축한다는 전략을 검증합니다.