Benchmark · agentic

GAIA

14 resultados 13 modelos

O GAIA (General AI Assistant) testa se assistentes de IA conseguem responder perguntas do mundo real e de várias etapas que exigem usar tools, navegar na web e raciocinar entre várias fontes. A pontuação é a porcentagem de perguntas respondidas corretamente.

Saiba mais
Exemplo
Um item típico é uma pergunta de aparência cotidiana cuja resposta está escondida em várias etapas — por exemplo, "procurar um dado em um documento vinculado e depois combiná-lo com dados de um site para chegar a uma única resposta curta" —, o que exige navegação e uso de tools em vez de uma única busca.
Pontuação
A métrica é a accuracy (acurácia): a proporção de perguntas cuja resposta final coincide com a resposta esperada. Cada pergunta tem uma única resposta de referência inequívoca, então a resposta está certa ou errada.
Verificação
As respostas são verificadas automaticamente por correspondência exata (quase exata) de strings com a resposta de referência, e os resultados do conjunto de teste são enviados a um leaderboard público onde as respostas corretas ficam privadas.
Por que importa
Ela mede a capacidade prática de um assistente — combinar raciocínio, navegação web e tools em tarefas fáceis para pessoas, mas difíceis para a IA —, tornando-se uma referência comum para agents autônomos.
Exemplo resolvido
Tarefa
Usando a Wikipedia em inglês atual, quantos álbuns de estúdio a banda Radiohead lançou de 1993 a 2007, inclusive? Dê um único número inteiro como resposta final.
Solução
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
Explicação
Os itens do GAIA têm uma única resposta de referência inequívoca, obtida por navegação na web mais uma agregação leve — aqui, contar as entradas da discografia dentro de um intervalo de datas (coletâneas e álbuns ao vivo são excluídos). É avaliado por quasi-exact match: a string da resposta final normalizada deve ser exatamente igual à referência «7».
0 23 46 69 92 2024-09-27 2025-09-03 2026-08-10 Trase · 35.5 · 2024-09-27 Trase · 67 · 2025-02-21 Enterprise h2oGPTe Agent · 65 · 2024-12-23 Deep Research · 67.4 · 2025-02-04 our agent · 55.1 · 2025-02-04 OpenAI Deep Research · 72.6 · 2025-02-21 OWL · 69.1 · 2025-03-07 Manus AI · 86.5 · 2025-03-10 h2oGPTe Agent · 75 · 2025-03-17 Alita · 75.2 · 2025-05-26 ALITA-G · 83.0 · 2025-10-27 MiroThinker v1.0 (72B variant) · 81.9 · 2025-11-14 Agents-A1 · 46.4 · 2026-07-06 Muse Glimmer · 43.3 · 2026-08-10
Trase Enterprise h2oGPTe Agent Deep Research our agent OpenAI Deep Research OWL Manus AI h2oGPTe Agent Alita ALITA-G MiroThinker v1.0 (72B variant) Agents-A1 Muse Glimmer
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-10 Muse Glimmer 43.3% Meta lança Muse Glimmer, um modelo agêntico de pesos abertos com 30B que roda em uma GPU de consumo
2026-07-06 Agents-A1 46.4pts Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhões de Parâmetros com um Agente de 35B
2025-11-14 MiroThinker v1.0 (72B variant) 81.9% MiroThinker v1.0 introduz escalonamento interativo para agentes de pesquisa de código aberto
2025-10-27 ALITA-G 83.03% ALITA-G autoevolui agentes gerando e curando ferramentas MCP
2025-05-26 Alita 75.15% Alita permite raciocínio agêntico escalável com mínima pré-definição e máxima autoevolução
2025-03-17 h2oGPTe Agent 75.0% Agente h2oGPTe da H2O.ai lidera o benchmark GAIA com 75% de precisão
2025-03-10 Manus AI 86.5% Manus AI é lançado como agente autônomo com resultados do benchmark GAIA
2025-03-07 OWL 69.09% OWL alcança o #1 no benchmark GAIA com pontuação de 69.09%
2025-02-21 Trase 67.0% Trase lidera o ranking GAIA com pontuação de 67% no teste e custo de 1/100
2025-02-21 OpenAI Deep Research 72.57% Trase lidera o ranking GAIA com pontuação de 67% no teste e custo de 1/100
2025-02-04 Deep Research 67.36% Reprodução do DeepResearch de código-fonte aberto alcança 55,15% no GAIA usando smolagents
2025-02-04 our agent 55.15% Reprodução do DeepResearch de código-fonte aberto alcança 55,15% no GAIA usando smolagents
2024-12-23 Enterprise h2oGPTe Agent 65.0% Agente h2oGPTe da H2O.ai lidera o benchmark GAIA com pontuação de 65%
2024-09-27 Trase 35.55% Trase lidera o ranking GAIA do Hugging Face com taxa de sucesso de 35.55%