Benchmark · agentic
GAIA
GAIA (General AI Assistant) evalúa si los asistentes de IA pueden responder preguntas del mundo real y de varios pasos que requieren usar tools, navegar por la web y razonar entre varias fuentes. La puntuación es el porcentaje de preguntas respondidas correctamente.
Leer más
- Ejemplo
- Un elemento típico es una pregunta de apariencia cotidiana cuya respuesta está oculta en varios pasos —por ejemplo, «buscar un dato en un documento enlazado y luego combinarlo con datos de un sitio web para llegar a una única respuesta corta»—, lo que exige navegación y uso de tools en lugar de una sola búsqueda.
- Puntuación
- La métrica es la accuracy (exactitud): la proporción de preguntas cuya respuesta final coincide con la respuesta esperada. Cada pregunta tiene una única respuesta de referencia inequívoca, así que la respuesta es correcta o incorrecta.
- Verificación
- Las respuestas se verifican automáticamente mediante coincidencia exacta (casi exacta) de cadenas con la respuesta de referencia, y los resultados del conjunto de prueba se envían a un leaderboard público donde las respuestas correctas se mantienen privadas.
- Por qué importa
- Mide la capacidad práctica de un asistente —combinar razonamiento, navegación web y tools en tareas fáciles para las personas pero difíciles para la IA—, lo que lo convierte en una referencia habitual para agents autónomos.
Ejemplo resuelto
Tarea
Usando la Wikipedia en inglés actual, ¿cuántos álbumes de estudio publicó la banda Radiohead entre 1993 y 2007, ambos incluidos? Da un único número entero como respuesta final.
Solución
Albums in range: Pablo Honey (1993), The Bends (1995), OK Computer (1997), Kid A (2000), Amnesiac (2001), Hail to the Thief (2003), In Rainbows (2007) → 7. Final answer: 7
Explicación
Los ítems de GAIA tienen una única respuesta de referencia inequívoca, obtenida mediante navegación web más una agregación ligera: aquí, contar las entradas de la discografía dentro de un intervalo de fechas (se excluyen recopilatorios y álbumes en directo). Se califica por quasi-exact match: la cadena de respuesta final normalizada debe coincidir exactamente con la referencia «7».