Benchmark · agentic

GAIA

13 resultados 12 modelos

GAIA (General AI Assistant) evalúa si los asistentes de IA pueden responder preguntas del mundo real y de varios pasos que requieren usar tools, navegar por la web y razonar entre varias fuentes. La puntuación es el porcentaje de preguntas respondidas correctamente.

Leer más
Ejemplo
Un elemento típico es una pregunta de apariencia cotidiana cuya respuesta está oculta en varios pasos —por ejemplo, «buscar un dato en un documento enlazado y luego combinarlo con datos de un sitio web para llegar a una única respuesta corta»—, lo que exige navegación y uso de tools en lugar de una sola búsqueda.
Puntuación
La métrica es la accuracy (exactitud): la proporción de preguntas cuya respuesta final coincide con la respuesta esperada. Cada pregunta tiene una única respuesta de referencia inequívoca, así que la respuesta es correcta o incorrecta.
Verificación
Las respuestas se verifican automáticamente mediante coincidencia exacta (casi exacta) de cadenas con la respuesta de referencia, y los resultados del conjunto de prueba se envían a un leaderboard público donde las respuestas correctas se mantienen privadas.
Por qué importa
Mide la capacidad práctica de un asistente —combinar razonamiento, navegación web y tools en tareas fáciles para las personas pero difíciles para la IA—, lo que lo convierte en una referencia habitual para agents autónomos.
Ejemplo resuelto
Tarea
Usando la Wikipedia en inglés actual, ¿cuántos álbumes de estudio publicó la banda Radiohead entre 1993 y 2007, ambos incluidos? Da un único número entero como respuesta final.
Solución
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
Explicación
Los ítems de GAIA tienen una única respuesta de referencia inequívoca, obtenida mediante navegación web más una agregación ligera: aquí, contar las entradas de la discografía dentro de un intervalo de fechas (se excluyen recopilatorios y álbumes en directo). Se califica por quasi-exact match: la cadena de respuesta final normalizada debe coincidir exactamente con la referencia «7».
0 23 46 69 92 2024-09-27 2025-08-13 2026-06-30 Trase · 35.5 · 2024-09-27 Trase · 67 · 2025-02-21 Enterprise h2oGPTe Agent · 65 · 2024-12-23 our agent · 55.1 · 2025-02-04 Deep Research · 67.4 · 2025-02-04 OpenAI Deep Research · 72.6 · 2025-02-21 OWL · 69.1 · 2025-03-07 Manus AI · 86.5 · 2025-03-10 h2oGPTe Agent · 75 · 2025-03-17 Alita · 75.2 · 2025-05-26 ALITA-G · 83.0 · 2025-10-27 MiroThinker v1.0 (72B variant) · 81.9 · 2025-11-14 Agents-A1 · 46.4 · 2026-06-30
Trase Enterprise h2oGPTe Agent our agent Deep Research OpenAI Deep Research OWL Manus AI h2oGPTe Agent Alita ALITA-G MiroThinker v1.0 (72B variant) Agents-A1
Cronología
Fecha Modelo Puntuación Fuente
2026-06-30 Agents-A1 46.4pts Escalar el horizonte, no los parámetros: alcanzar rendimiento de billones de parámetros con un agente de 35B
2025-11-14 MiroThinker v1.0 (72B variant) 81.9% MiroThinker v1.0 introduce escalado interactivo para agentes de investigación de código abierto
2025-10-27 ALITA-G 83.03% ALITA-G autoevoluciona agentes generando y curando herramientas MCP
2025-05-26 Alita 75.15% Alita permite el razonamiento agénico escalable con mínima predefinición y máxima autoevolución
2025-03-17 h2oGPTe Agent 75.0% El agente h2oGPTe de H2O.ai lidera el benchmark GAIA con un 75% de precisión
2025-03-10 Manus AI 86.5% Manus AI se lanza como agente autónomo con resultados en el benchmark GAIA
2025-03-07 OWL 69.09% OWL alcanza el #1 en el benchmark GAIA con una puntuación de 69.09%
2025-02-21 OpenAI Deep Research 72.57% Trase encabeza el ranking GAIA con un 67% de aciertos en la prueba a 1/100 del coste
2025-02-21 Trase 67.0% Trase encabeza el ranking GAIA con un 67% de aciertos en la prueba a 1/100 del coste
2025-02-04 our agent 55.15% La reproducción de DeepResearch de código abierto alcanza 55.15% en GAIA usando smolagents
2025-02-04 Deep Research 67.36% La reproducción de DeepResearch de código abierto alcanza 55.15% en GAIA usando smolagents
2024-12-23 Enterprise h2oGPTe Agent 65.0% El agente h2oGPTe de H2O.ai lidera el benchmark GAIA con un puntaje del 65%
2024-09-27 Trase 35.55% Trase encabeza el ranking GAIA de Hugging Face con una tasa de éxito del 35.55%