Benchmark · agentic

BrowseComp

24 resultados 21 modelos

BrowseComp es el benchmark de OpenAI para agentes de IA que navegan por la web; comprueba si son capaces de rastrear datos difíciles de encontrar dispersos por internet. El resultado se expresa como el porcentaje de preguntas respondidas correctamente.

Leer más
Ejemplo
Un ítem típico plantea una pregunta cuya respuesta breve y factual —un nombre, una fecha o un número— está enterrada en la web y exige una búsqueda persistente de varios pasos por muchas páginas.
Puntuación
La métrica es la exactitud (accuracy): el porcentaje de preguntas en las que la respuesta del agente coincide con la única respuesta correcta conocida.
Verificación
Una respuesta se acepta cuando coincide con la respuesta de referencia predeterminada (estilo coincidencia exacta); las preguntas se diseñan para que la respuesta sea difícil de encontrar pero fácil de verificar una vez dada.
Por qué importa
Pone a prueba una capacidad que los chatbots normales no tienen —investigación web profunda y persistente en muchos pasos—, por lo que sigue siendo una prueba exigente de navegación agéntica incluso para modelos potentes.
Ejemplo resuelto
Tarea
Ítem de BrowseComp: «Nombra un largometraje estrenado entre 2010 y 2015 que (1) ganara el Óscar a la mejor película, (2) dramatice una única operación encubierta de rescate, (3) fuera dirigido por la misma persona que interpreta el papel protagonista y (4) tenga su clímax en un aeropuerto de Teherán. Da solo el título de la película.»
Solución
Las restricciones convergen en una sola película: una ganadora del Óscar a la mejor película de 2010–2015 que es un drama de rescate encubierto dirigido por su protagonista y con clímax en un aeropuerto de Teherán. Respuesta final: Argo (2012), dirigida y protagonizada por Ben Affleck.
Explicación
Cada pista reduce el conjunto de candidatas —ganadoras del Óscar a la mejor película en 2010–2015, luego los dramas de rescate dirigidos por su protagonista, y por último la que culmina en el aeropuerto de Teherán—, dejando solo a Argo, que Ben Affleck dirigió y protagonizó. BrowseComp compara una respuesta breve de texto libre con la referencia mediante coincidencia exacta o verificada por modelo, así que «Argo» se marca como correcta.
0 24.5 49 73.5 98 2025-04-10 2025-11-27 2026-07-17 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 GPT-5.5 · 84.4 · 2026-04-23 Gemini 3.1 Pro · 85.9 · 2026-04-23 Agents-A1 · 75.5 · 2026-06-30 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro GPT-5.5 Gemini 3.1 Pro Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 OpenAI Deep Research
Cronología
Fecha Modelo Puntuación Fuente
2026-07-17 Kimi K3 91.2% Moonshot AI lanza Kimi K3 abierto, un modelo MoE de 2.8T parámetros con contexto de 1M
2026-07-17 GPT-Live-1 75.2% OpenAI lanza modelos de voz full-dúplex y un tribunal alemán considera responsable a Google por las Resúmenes de IA
2026-07-16 Qwen3-4B 35.6% TRACE mejora el uso de herramientas en agentes de horizonte largo mediante estimación de crédito por turno
2026-07-16 Qwen3-30B-A3B 42.6% TRACE mejora el uso de herramientas en agentes de horizonte largo mediante estimación de crédito por turno
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: El modelo agénico MoE de 35B iguala a modelos más grandes mediante optimización post-entrenamiento
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: modelo agénico MoE de 35B iguala a modelos más grandes mediante optimización post-entrenamiento
2026-07-09 GPT-5.6 Sol 92.2% OpenAI lanza la familia GPT-5.6 con modelos Sol, Terra y Luna
2026-06-30 Agents-A1 75.5pts Escalar el horizonte, no los parámetros: alcanzar rendimiento de billones de parámetros con un agente de 35B
2026-04-23 GPT-5.5 84.4% OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
2026-04-21 Opus 4.6 84.0% Google lanza los agentes Deep Research y Deep Research Max basados en Gemini 3.1 Pro
2026-04-21 GPT-5.4 82.7% Google lanza los agentes Deep Research y Deep Research Max basados en Gemini 3.1 Pro
2026-04-21 GPT-5.4 Pro 89.3% Google lanza los agentes Deep Research y Deep Research Max basados en Gemini 3.1 Pro
2026-03-06 Claude Opus 4.6 83.73% Anthropic publica la tarjeta del sistema de Claude Opus 4.6 detallando capacidades y evaluaciones de seguridad
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen lanza el modelo Qwen3.5-397B-A17B cuantizado en FP8
2026-02-10 Step 3.5 Flash 69.0% Paso 3.5 Flash: modelo MoE abierto con 11B activos alcanza rendimiento de agente de nivel fronterizo
2026-02-05 Claude Opus 4.6 84.0% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2026-02-05 Claude Opus 4.6 83.73% Anthropic publica la tarjeta del sistema de Claude Opus 4.6 detallando capacidades y evaluaciones de seguridad
2026-01-27 Kimi K2.5 74.9% Moonshot lanza Kimi K2.5 con tecnología Agent Swarm
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 introduce escalado interactivo para agentes de investigación de código abierto
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI lanza Kimi K2 Thinking, un modelo de razonamiento de código abierto con 1T parámetros
2025-09-16 Tongyi DeepResearch 43.4% Tongyi lanza DeepResearch, un agente web de código abierto que iguala el rendimiento propietario
2025-08-06 GLM-4.5 26.4% Zhipu AI lanza los modelos GLM-4.5 que igualan a Claude y DeepSeek
2025-04-10 OpenAI Deep Research 51.5% OpenAI