H2O.ai annonce que son agent h2oGPTe a atteint la première place du benchmark General AI Assistants (GAIA), atteignant un taux de précision de 75 %. Ce résultat marque la première fois qu'une note de C est obtenue sur l'ensemble de test GAIA et place l'agent devant le Deep Research d'OpenAI tout en égalant les performances de Manus.

  • L'agent utilise Claude 3.7 Sonnet d'Anthropic avec un mode de raisonnement spécialisé pour les tâches analytiques complexes.
  • Les nouvelles capacités incluent une navigation sophistiquée dans le navigateur, une recherche unifiée sur plusieurs moteurs comme Google et Bing, et une intégration GitHub pour l'ingénierie logicielle.
  • H2O.ai souligne que ses résultats sont basés sur l'ensemble de test GAIA plutôt que sur l'ensemble de validation, citant une contamination potentielle des données dans ce dernier.
  • La plateforme propose désormais une attribution des sources en direct et des citations intégrées aux réponses pour améliorer la transparence.

Cette réussite valide l'approche de H2O.ai pour créer des assistants IA capables de gérer des tâches du monde réel nécessitant du raisonnement, du multimodal et l'utilisation d'outils.