Benchmark · agentic

GAIA

14 résultats 13 modèles

GAIA (General AI Assistant) teste si les assistants d'IA peuvent répondre à des questions réelles et à plusieurs étapes qui nécessitent d'utiliser des tools, de naviguer sur le web et de raisonner à travers plusieurs sources. Le score est le pourcentage de questions correctement répondues.

En savoir plus
Exemple
Un élément typique est une question d'apparence banale dont la réponse est cachée à travers plusieurs étapes — par exemple « chercher un fait dans un document lié, puis le combiner avec des données d'un site web pour aboutir à une seule réponse courte » —, ce qui exige de la navigation et des tools plutôt qu'une seule recherche.
Notation
La métrique est l'accuracy (exactitude) : la proportion de questions dont la réponse finale correspond à la réponse attendue. Chaque question a une unique réponse de référence sans ambiguïté, donc la réponse est juste ou fausse.
Vérification
Les réponses sont vérifiées automatiquement par correspondance exacte (quasi exacte) de chaînes avec la réponse de référence, et les résultats de l'ensemble de test sont soumis à un leaderboard public où les bonnes réponses restent privées.
Pourquoi c'est important
Elle mesure la capacité pratique d'un assistant — combiner raisonnement, navigation web et tools sur des tâches faciles pour les humains mais difficiles pour l'IA —, ce qui en fait une référence courante pour les agents autonomes.
Exemple résolu
Tâche
En utilisant la version actuelle de Wikipedia en anglais, combien d'albums studio le groupe Radiohead a-t-il publiés de 1993 à 2007 inclus ? Donnez un seul entier comme réponse finale.
Solution
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
Explication
Les items de GAIA ont une unique réponse de référence sans ambiguïté, obtenue par navigation web plus une agrégation légère — ici, compter les entrées de la discographie dans un intervalle de dates (compilations et albums live exclus). L'évaluation se fait par quasi-exact match : la chaîne de réponse finale normalisée doit être exactement égale à la référence « 7 ».
0 23 46 69 92 2024-09-27 2025-09-03 2026-08-10 Trase · 35.5 · 2024-09-27 Trase · 67 · 2025-02-21 Enterprise h2oGPTe Agent · 65 · 2024-12-23 Deep Research · 67.4 · 2025-02-04 our agent · 55.1 · 2025-02-04 OpenAI Deep Research · 72.6 · 2025-02-21 OWL · 69.1 · 2025-03-07 Manus AI · 86.5 · 2025-03-10 h2oGPTe Agent · 75 · 2025-03-17 Alita · 75.2 · 2025-05-26 ALITA-G · 83.0 · 2025-10-27 MiroThinker v1.0 (72B variant) · 81.9 · 2025-11-14 Agents-A1 · 46.4 · 2026-07-06 Muse Glimmer · 43.3 · 2026-08-10
Trase Enterprise h2oGPTe Agent Deep Research our agent OpenAI Deep Research OWL Manus AI h2oGPTe Agent Alita ALITA-G MiroThinker v1.0 (72B variant) Agents-A1 Muse Glimmer
Chronologie
Date Modèle Score Source
2026-08-10 Muse Glimmer 43.3% Meta publie Muse Glimmer, un modèle agentique open-weights de 30B fonctionnant sur un GPU grand public
2026-07-06 Agents-A1 46.4pts Étendre l'horizon, pas les paramètres : atteindre des performances de modèles à mille milliards de paramètres avec un agent de 35M
2025-11-14 MiroThinker v1.0 (72B variant) 81.9% MiroThinker v1.0 introduit le scaling interactif pour les agents de recherche open-source
2025-10-27 ALITA-G 83.03% ALITA-G fait évoluer ses agents en générant et curant des outils MCP
2025-05-26 Alita 75.15% Alita permet un raisonnement agentique évolutif avec une prédéfinition minimale et une auto-évolution maximale
2025-03-17 h2oGPTe Agent 75.0% L'agent h2oGPTe de H2O.ai domine le benchmark GAIA avec 75 % de précision
2025-03-10 Manus AI 86.5% Manus AI lancé en tant qu'agent autonome avec des résultats au benchmark GAIA
2025-03-07 OWL 69.09% OWL atteint la #1 sur le benchmark GAIA avec un score de 69.09%
2025-02-21 Trase 67.0% Trase en tête du classement GAIA avec un score de test de 67 % pour 1/100e du coût
2025-02-21 OpenAI Deep Research 72.57% Trase en tête du classement GAIA avec un score de test de 67 % pour 1/100e du coût
2025-02-04 Deep Research 67.36% La reproduction de DeepResearch open-source atteint 55,15 % sur GAIA avec smolagents
2025-02-04 our agent 55.15% La reproduction de DeepResearch open-source atteint 55,15 % sur GAIA avec smolagents
2024-12-23 Enterprise h2oGPTe Agent 65.0% L'agent h2oGPTe d'H2O.ai atteint le sommet du benchmark GAIA avec un score de 65 %
2024-09-27 Trase 35.55% Trase en tête du classement GAIA de Hugging Face avec un taux de réussite de 35.55%