H2O.ai a annoncé que son agent d'entreprise h2oGPTe a obtenu la première place du classement du benchmark GAIA (General AI Assistants), avec un score de 65 %. Ce résultat surpasse significativement les autres soumissions majeures, notamment l'agent Langfun de Google à 49 % et l'utilisation par Microsoft Research du modèle OpenAI o1 à 38 %.

  • Le benchmark GAIA, créé par Meta-FAIR, HuggingFace et d'autres, teste les capacités des IA sur des tâches réelles nécessitant du raisonnement, la gestion de la multi-modnalité et l'utilisation d'outils à travers 466 questions.
  • h2oGPTe atteint ce score grâce à une approche simplifiée utilisant Sonnet 3.5 d'Anthropic, la mise en cache des prompts et un échafaudage minimal, plutôt qu'une orchestration complexe de multiples agents.
  • L'intègre des outils pour la navigation web, l'exécution de code, la gestion de fichiers et la modélisation en data science, sans nécessiter de réglage fin (fine-tuning) des modèles de base.
  • Cette performance met en évidence un passage des applications SaaS autonomes aux agents IA capables d'orchestrer plusieurs outils et sources de données pour les flux de travail professionnels.

Cette réussite valide la stratégie de H2O.ai consistant à développer des systèmes IA adaptatifs et économiques, capables d'assister dans des tâches pratiques sans contraintes architecturales rigides.