벤치마크 · agentic

BrowseComp

26 결과 23 모델

BrowseComp는 웹을 탐색하는 AI 에이전트를 위한 OpenAI의 벤치마크로, 인터넷 곳곳에 흩어진 찾기 어려운 사실을 추적해 낼 수 있는지를 평가합니다. 결과는 정답을 맞힌 문제의 비율(퍼센트)로 보고됩니다.

자세히 보기
예시
전형적인 문항은 짧은 사실형 답(이름·날짜·숫자 등)이 웹 깊숙이 묻혀 있어, 이를 찾으려면 여러 페이지를 넘나드는 끈질긴 다단계 검색이 필요한 질문을 냅니다.
채점 방식
지표는 정확도(accuracy)로, 에이전트의 답이 유일한 정답과 일치한 문제의 비율입니다.
검증 방식
답은 미리 정해진 정답과 일치할 때 인정됩니다(정확 일치 방식). 문항은 답을 찾기는 어렵지만 주어지면 검증하기는 쉽도록 설계됩니다.
왜 중요한가
일반 챗봇에는 없는 능력——여러 단계에 걸친 끈질기고 깊이 있는 웹 리서치——을 시험하기 때문에, 강력한 모델에게도 에이전트형 브라우징의 까다로운 시험대로 남아 있습니다.
예제 풀이
문제
BrowseComp 문항: 「2010년에서 2015년 사이에 개봉한 장편 영화 중 (1) 아카데미 작품상을 수상하고, (2) 하나의 비밀 구출 작전을 극화하며, (3) 주연을 맡은 바로 그 사람이 감독하고, (4) 클라이맥스가 테헤란의 공항에서 펼쳐지는 작품을 말하시오. 영화 제목만 답하시오.」
해답
제약들이 한 편의 영화로 수렴한다 — 2010–2015년 아카데미 작품상 수상작이자 주연 본인이 감독한 비밀 구출 드라마로, 클라이맥스가 테헤란 공항에서 벌어지는 작품. 최종 답: Argo (2012), 감독 및 주연 Ben Affleck.
풀이
각 단서가 후보를 좁혀 간다 — 2010–2015년 작품상 수상작, 그다음 주연이 직접 감독한 구출 드라마, 마지막으로 테헤란 공항에서 클라이맥스를 맞는 작품 — 남는 것은 Argo뿐이며, Ben Affleck이 감독과 주연을 겸했다. BrowseComp는 짧은 자유 서술 답을 참조 답과 정확 일치 또는 모델 판정으로 대조하므로 「Argo」는 정답으로 채점된다.
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
타임라인
날짜 모델 점수 출처
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAI, 저렴한 비용으로 고품질 에이전트 워크플로우를 위한 GPT-5.6 출시
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAI, 저렴한 비용으로 고품질 에이전트 워크플로우를 위한 GPT-5.6 출시
2026-07-17 Kimi K3 91.2% 문샷 AI가 100만 토큰 컨텍스트를 지원하는 2.8T 파라미터 MoE 모델인 오픈 Kimi K3 출시
2026-07-17 GPT-Live-1 75.2% OpenAI, 풀듀플렉스 음성 모델 출시 및 독일 법원이 AI 오버뷰에 대해 구글을 책임 있게 판결
2026-07-16 Qwen3-4B 35.6% TRACE는 턴 레벨 신용 추정을 통해 장기 에이전트의 도구 사용 능력을 개선합니다
2026-07-16 Qwen3-30B-A3B 42.6% TRACE는 턴 레벨 신용 추정을 통해 장기 에이전트의 도구 사용 능력을 개선합니다
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: 35B MoE 에이전트 모델이 사후 학습 최적화를 통해 더 큰 모델과 동등한 성능 발휘
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: 35B MoE 에이전트 모델이 사후 훈련 최적화를 통해 더 큰 모델과 동등한 성능 발휘
2026-07-09 GPT-5.6 Sol 92.2% OpenAI, Sol, Terra, Luna 모델 탑재 GPT-5.6 패밀리 출시
2026-07-06 Agents-A1 75.5pts 파라미터가 아닌 에이전트 지평 확장: 35B 에이전트로 트릴리언 파라미터 성능 달성
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI, 에이전트 기능과 두 배의 API 가격으로 GPT-5.5 출시
2026-04-23 GPT-5.5 84.4% OpenAI, 에이전트 기능과 두 배의 API 가격으로 GPT-5.5 출시
2026-04-21 Opus 4.6 84.0% 구글, Gemini 3.1 Pro 기반의 Deep Research 및 Deep Research Max 에이전트 출시
2026-04-21 GPT-5.4 82.7% 구글, Gemini 3.1 Pro 기반의 Deep Research 및 Deep Research Max 에이전트 출시
2026-04-21 GPT-5.4 Pro 89.3% 구글, Gemini 3.1 Pro 기반의 Deep Research 및 Deep Research Max 에이전트 출시
2026-03-06 Claude Opus 4.6 83.73% Anthropic, Claude Opus 4.6 시스템 카드 공개 및 기능과 안전성 평가 상세 내용 발표
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen, FP8 양자화된 Qwen3.5-397B-A17B 모델 출시
2026-02-10 Step 3.5 Flash 69.0% 단계 3.5 Flash: 11B 활성 MoE 모델이 최전선 에이전트 성능 달성
2026-02-05 Claude Opus 4.6 84.0% Anthropic, 1M 컨텍스트 창과 에이전트 기능 개선을 갖춘 Claude Opus 4.6 출시
2026-02-05 Claude Opus 4.6 83.73% Anthropic, Claude Opus 4.6 시스템 카드 발표: 기능 및 안전성 평가 상세 내용
2026-01-27 Kimi K2.5 74.9% Moonshot, 에이전트 스웜 기술 탑재 Kimi K2.5 출시
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0이 오픈소스 연구 에이전트를 위한 상호작용 스케일링 도입
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI, 오픈소스 1T 파라미터 추론 모델 Kimi K2 Thinking 출시
2025-09-16 Tongyi DeepResearch 43.4% Tongyi가 독점 성능에 맞먹는 오픈소스 웹 에이전트 DeepResearch 출시
2025-08-06 GLM-4.5 26.4% 지푸 AI가 Claude와 DeepSeek에 맞먹는 GLM-4.5 모델 출시
2025-04-10 OpenAI Deep Research 51.5% OpenAI