Benchmark · agentic

BrowseComp

26 résultats 23 modèles

BrowseComp est le benchmark d'OpenAI pour les agents d'IA qui naviguent sur le web ; il vérifie s'ils parviennent à retrouver des faits difficiles à localiser, disséminés sur internet. Le résultat est exprimé comme le pourcentage de questions correctement répondues.

En savoir plus
Exemple
Un item typique pose une question dont la réponse factuelle brève — un nom, une date ou un nombre — est enfouie au fond du web et exige une recherche tenace, en plusieurs étapes, à travers de nombreuses pages.
Notation
La métrique est l'exactitude (accuracy) : le pourcentage de questions pour lesquelles la réponse de l'agent correspond à l'unique réponse correcte connue.
Vérification
Une réponse est acceptée lorsqu'elle correspond à la réponse de référence prédéfinie (correspondance exacte) ; les questions sont conçues pour que la réponse soit difficile à trouver mais facile à vérifier une fois donnée.
Pourquoi c'est important
Il sonde une compétence que les chatbots ordinaires n'ont pas — une recherche web profonde et tenace sur de nombreuses étapes —, ce qui en fait un test exigeant de navigation agentique, même pour des modèles puissants.
Exemple résolu
Tâche
Item BrowseComp : « Nommez un long-métrage sorti entre 2010 et 2015 qui (1) a remporté l'Oscar du meilleur film, (2) met en scène une seule opération de sauvetage clandestine, (3) a été réalisé par la personne qui en tient le rôle principal et (4) atteint son point culminant dans un aéroport de Téhéran. Donnez uniquement le titre du film. »
Solution
Les contraintes convergent vers un seul film — un lauréat de l'Oscar du meilleur film de 2010–2015 qui est un drame de sauvetage clandestin réalisé par son acteur principal et dont le point culminant se déroule dans un aéroport de Téhéran. Réponse finale : Argo (2012), réalisé par et avec Ben Affleck.
Explication
Chaque indice réduit l'ensemble des candidats — lauréats de l'Oscar du meilleur film en 2010–2015, puis les drames de sauvetage réalisés par leur acteur principal, enfin celui dont le point culminant est à l'aéroport de Téhéran — ne laissant que Argo, que Ben Affleck a à la fois réalisé et interprété. BrowseComp compare une courte réponse en texte libre à la référence par correspondance exacte ou vérifiée par modèle, donc « Argo » est compté correct.
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
Chronologie
Date Modèle Score Source
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAI lance GPT-5.6 pour des flux de travail agents abordables et haute performance
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAI lance GPT-5.6 pour des flux de travail agents abordables et haute performance
2026-07-17 Kimi K3 91.2% Moonshot AI publie Kimi K3 ouvert, un modèle MoE de 2,8 T de paramètres avec un contexte de 1 M
2026-07-17 GPT-Live-1 75.2% OpenAI publie des modèles vocaux full-duplex et un tribunal allemand tient Google responsable des Résumés IA
2026-07-16 Qwen3-4B 35.6% TRACE améliore l'utilisation d'outils par les agents à long terme via l'estimation du crédit au niveau des tours
2026-07-16 Qwen3-30B-A3B 42.6% TRACE améliore l'utilisation d'outils par les agents à long terme via l'estimation du crédit au niveau des tours
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash : le modèle agentique MoE de 35B égale les modèles plus grands grâce à l'optimisation post-entraînement
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash : le modèle agentique MoE de 35B égale les modèles plus grands grâce à l'optimisation post-entraînement
2026-07-09 GPT-5.6 Sol 92.2% OpenAI lance la famille GPT-5.6 avec les modèles Sol, Terra et Luna
2026-07-06 Agents-A1 75.5pts Étendre l'horizon, pas les paramètres : atteindre des performances de modèles à mille milliards de paramètres avec un agent de 35M
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI lance GPT-5.5 avec des capacités agentic et un doublement du prix de l'API
2026-04-23 GPT-5.5 84.4% OpenAI lance GPT-5.5 avec des capacités agentic et un doublement du prix de l'API
2026-04-21 Opus 4.6 84.0% Google lance les agents Deep Research et Deep Research Max basés sur Gemini 3.1 Pro
2026-04-21 GPT-5.4 82.7% Google lance les agents Deep Research et Deep Research Max basés sur Gemini 3.1 Pro
2026-04-21 GPT-5.4 Pro 89.3% Google lance les agents Deep Research et Deep Research Max basés sur Gemini 3.1 Pro
2026-03-06 Claude Opus 4.6 83.73% Anthropic publie la fiche système de Claude Opus 4.6 détaillant les capacités et les évaluations de sécurité
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen publie le modèle Qwen3.5-397B-A17B quantisé en FP8
2026-02-10 Step 3.5 Flash 69.0% Étape 3.5 Flash : un modèle MoE à 11B actifs atteint des performances agentic de pointe
2026-02-05 Claude Opus 4.6 84.0% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2026-02-05 Claude Opus 4.6 83.73% Anthropic publie la fiche système de Claude Opus 4.6 détaillant les capacités et les évaluations de sécurité
2026-01-27 Kimi K2.5 74.9% Moonshot lance Kimi K2.5 avec la technologie Agent Swarm
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 introduit le scaling interactif pour les agents de recherche open-source
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement open-source de 1T paramètres
2025-09-16 Tongyi DeepResearch 43.4% Tongyi lance DeepResearch, un agent web open-source aux performances égales aux solutions propriétaires
2025-08-06 GLM-4.5 26.4% Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek
2025-04-10 OpenAI Deep Research 51.5% OpenAI