Бенчмарк · agentic

BrowseComp

24 результатов 21 моделей

BrowseComp — это бенчмарк OpenAI для ИИ-агентов, работающих с веб-браузером; он проверяет, способны ли они разыскивать труднонаходимые факты, разбросанные по интернету. Результат выражается в проценте вопросов, на которые дан правильный ответ.

Подробнее
Пример
Типичное задание — вопрос, короткий фактический ответ на который (имя, дата или число) спрятан глубоко в сети, и чтобы его найти, требуется настойчивый многошаговый поиск по множеству страниц.
Метрика
Метрика — точность (accuracy): доля вопросов, где ответ агента совпадает с единственным известным правильным ответом.
Приёмка
Ответ засчитывается, если он совпадает с заранее заданным эталонным ответом (проверка по точному совпадению); вопросы составлены так, что ответ трудно найти, но легко проверить, когда он дан.
Почему важно
Бенчмарк проверяет навык, которого нет у обычных чат-ботов, — глубокий, настойчивый веб-поиск в много шагов, поэтому он остаётся сложным испытанием для агентного браузинга даже для сильных моделей.
Разбор примера
Задача
Задание BrowseComp: «Назовите полнометражный фильм, вышедший между 2010 и 2015 годами, который (1) получил премию Academy Award за лучший фильм, (2) драматизирует одну тайную спасательную операцию, (3) снят тем же человеком, который играет главную роль, и (4) достигает кульминации в аэропорту Тегерана. Укажите только название фильма.»
Решение
Ограничения пересекаются на одном фильме — победителе за лучший фильм 2010–2015 годов, который является драмой о тайном спасении с режиссёром в главной роли и кульминацией в аэропорту Тегерана. Итоговый ответ: Argo (2012), режиссёр и исполнитель главной роли — Ben Affleck.
Разбор
Каждая подсказка сужает круг кандидатов — победители за лучший фильм 2010–2015, затем драмы о спасении с режиссёром в главной роли, затем единственная с кульминацией в аэропорту Тегерана — оставляя только Argo, который Ben Affleck и снял, и сыграл в нём. BrowseComp сверяет короткий текстовый ответ с эталоном по точному или модельному совпадению, поэтому «Argo» засчитывается как правильный.
0 24.5 49 73.5 98 2025-04-10 2025-11-27 2026-07-17 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 GPT-5.5 · 84.4 · 2026-04-23 Gemini 3.1 Pro · 85.9 · 2026-04-23 Agents-A1 · 75.5 · 2026-06-30 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro GPT-5.5 Gemini 3.1 Pro Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 OpenAI Deep Research
Хронология
Дата Модель Результат Источник
2026-07-17 Kimi K3 91.2% Moonshot AI выпустила открытую модель Kimi K3 с 2,8 трлн параметров и контекстом в 1 млн токенов
2026-07-17 GPT-Live-1 75.2% OpenAI выпустила полнодуплексные голосовые модели, а немецкий суд признал Google ответственным за ИИ-обзоры
2026-07-16 Qwen3-4B 35.6% TRACE улучшает долгосрочное использование инструментов агентами через оценку кредита на уровне шагов
2026-07-16 Qwen3-30B-A3B 42.6% TRACE улучшает долгосрочное использование инструментов агентами через оценку кредита на уровне шагов
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: 35B MoE agentic модель сопоставима с более крупными моделями благодаря оптимизации после обучения
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: 35B MoE агентная модель достигает уровня более крупных моделей благодаря оптимизации после обучения
2026-07-09 GPT-5.6 Sol 92.2% OpenAI запускает семейство GPT-5.6 с моделями Sol, Terra и Luna
2026-06-30 Agents-A1 75.5pts Масштабирование горизонта, а не параметров: достижение производительности триллионных моделей с агентом на 35B
2026-04-23 GPT-5.5 84.4% OpenAI выпустила GPT-5.5 с агентными возможностями и удвоенной ценой API
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI выпустила GPT-5.5 с агентными возможностями и удвоенной ценой API
2026-04-21 Opus 4.6 84.0% Google запускает агентов Deep Research и Deep Research Max на базе Gemini 3.1 Pro
2026-04-21 GPT-5.4 82.7% Google запускает агентов Deep Research и Deep Research Max на базе Gemini 3.1 Pro
2026-04-21 GPT-5.4 Pro 89.3% Google запускает агентов Deep Research и Deep Research Max на базе Gemini 3.1 Pro
2026-03-06 Claude Opus 4.6 83.73% Anthropic выпустила системную карточку Claude Opus 4.6 с описанием возможностей и оценок безопасности
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen выпустила модель Qwen3.5-397B-A17B с FP8-квантованием
2026-02-10 Step 3.5 Flash 69.0% Шаг 3.5 Flash: открытая MoE-модель с 11B активных параметров достигает уровня передовых агентов
2026-02-05 Claude Opus 4.6 84.0% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2026-02-05 Claude Opus 4.6 83.73% Anthropic опубликовала системную карточку Claude Opus 4.6 с описанием возможностей и оценок безопасности
2026-01-27 Kimi K2.5 74.9% Moonshot выпустила Kimi K2.5 с технологией Agent Swarm
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 представляет интерактивное масштабирование для исследовательских агентов с открытым исходным кодом
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI выпустила Kimi K2 Thinking, открытую модель рассуждений на 1 трлн параметров
2025-09-16 Tongyi DeepResearch 43.4% Tongyi выпустила DeepResearch — открытый веб-агент, сопоставимый по производительности с проприетарными решениями
2025-08-06 GLM-4.5 26.4% Zhipu AI выпустила модели GLM-4.5, сопоставимые с Claude и DeepSeek
2025-04-10 OpenAI Deep Research 51.5% OpenAI