Benchmark · agentic

BrowseComp

26 resultados 23 modelos

BrowseComp é o benchmark da OpenAI para agentes de IA que navegam na web, testando se conseguem rastrear fatos difíceis de encontrar espalhados pela internet. O resultado é relatado como a porcentagem de perguntas respondidas corretamente.

Saiba mais
Exemplo
Um item típico faz uma pergunta cuja resposta factual curta — um nome, data ou número — está escondida no fundo da web e exige uma busca persistente e de várias etapas por muitas páginas.
Pontuação
A métrica é a acurácia (accuracy): a porcentagem de perguntas em que a resposta do agente coincide com a única resposta correta conhecida.
Verificação
Uma resposta é aceita quando coincide com a resposta de referência predefinida (estilo correspondência exata); as perguntas são elaboradas para que a resposta seja difícil de encontrar, mas fácil de verificar depois de dada.
Por que importa
Ela testa uma habilidade que os chatbots comuns não têm — pesquisa web profunda e persistente em várias etapas —, permanecendo um teste exigente de navegação agêntica mesmo para modelos fortes.
Exemplo resolvido
Tarefa
Item do BrowseComp: «Nomeie um longa-metragem lançado entre 2010 e 2015 que (1) venceu o Oscar de melhor filme, (2) dramatiza uma única operação secreta de resgate, (3) foi dirigido pela mesma pessoa que interpreta o papel principal e (4) tem seu clímax em um aeroporto de Teerã. Dê apenas o título do filme.»
Solução
As restrições convergem em um único filme — um vencedor do Oscar de melhor filme de 2010–2015 que é um drama de resgate secreto dirigido pelo próprio protagonista e com clímax em um aeroporto de Teerã. Resposta final: Argo (2012), dirigido e estrelado por Ben Affleck.
Explicação
Cada pista reduz o conjunto de candidatos — vencedores do Oscar de melhor filme em 2010–2015, depois os dramas de resgate dirigidos pelo protagonista e, por fim, o que culmina no aeroporto de Teerã — restando apenas Argo, que Ben Affleck dirigiu e estrelou. O BrowseComp compara uma resposta curta em texto livre com a referência por correspondência exata ou verificada por modelo, então «Argo» é marcado como correto.
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAI lança GPT-5.6 para fluxos de trabalho agênticos acessíveis e de alto desempenho
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAI lança GPT-5.6 para fluxos de trabalho agênticos acessíveis e de alto desempenho
2026-07-17 Kimi K3 91.2% Moonshot AI lança o Kimi K3 aberto, um modelo MoE de 2,8T parâmetros com contexto de 1M
2026-07-17 GPT-Live-1 75.2% OpenAI lança modelos de voz full-duplex e tribunal alemão responsabiliza o Google por Visões Gerais da IA
2026-07-16 Qwen3-4B 35.6% TRACE melhora o uso de ferramentas por agentes de longo prazo via estimativa de crédito por turno
2026-07-16 Qwen3-30B-A3B 42.6% TRACE melhora o uso de ferramentas por agentes de longo prazo via estimativa de crédito por turno
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: Modelo agêntico MoE de 35B iguala modelos maiores via otimização pós-treinamento
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: modelo agêntico MoE de 35B iguala modelos maiores por meio de otimização pós-treinamento
2026-07-09 GPT-5.6 Sol 92.2% OpenAI lança a família GPT-5.6 com modelos Sol, Terra e Luna
2026-07-06 Agents-A1 75.5pts Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhões de Parâmetros com um Agente de 35B
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI lança GPT-5.5 com capacidades agênticas e preço de API dobrado
2026-04-23 GPT-5.5 84.4% OpenAI lança GPT-5.5 com capacidades agênticas e preço de API dobrado
2026-04-21 Opus 4.6 84.0% Google lança agentes Deep Research e Deep Research Max baseados no Gemini 3.1 Pro
2026-04-21 GPT-5.4 82.7% Google lança agentes Deep Research e Deep Research Max baseados no Gemini 3.1 Pro
2026-04-21 GPT-5.4 Pro 89.3% Google lança agentes Deep Research e Deep Research Max baseados no Gemini 3.1 Pro
2026-03-06 Claude Opus 4.6 83.73% Anthropic lança cartão do sistema Claude Opus 4.6 detalhando capacidades e avaliações de segurança
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen lança modelo Qwen3.5-397B-A17B quantizado em FP8
2026-02-10 Step 3.5 Flash 69.0% Passo 3.5 Flash: modelo MoE aberto com 11B ativos atinge desempenho de agente de nível fronteira
2026-02-05 Claude Opus 4.6 84.0% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2026-02-05 Claude Opus 4.6 83.73% Anthropic publica o cartão do sistema do Claude Opus 4.6 detalhando capacidades e avaliações de segurança
2026-01-27 Kimi K2.5 74.9% Moonshot lança Kimi K2.5 com tecnologia Agent Swarm
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 introduz escalonamento interativo para agentes de pesquisa de código aberto
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI lança Kimi K2 Thinking, um modelo de raciocínio open-source com 1T parâmetros
2025-09-16 Tongyi DeepResearch 43.4% Tongyi lança o DeepResearch, um agente web de código aberto que iguala o desempenho proprietário
2025-08-06 GLM-4.5 26.4% Zhipu AI lança modelos GLM-4.5 que igualam Claude e DeepSeek
2025-04-10 OpenAI Deep Research 51.5% OpenAI