Benchmark · agentic

BrowseComp

26 hasil 23 model

BrowseComp adalah benchmark buatan OpenAI untuk agen AI penjelajah web, yang menguji apakah mereka mampu melacak fakta yang sulit ditemukan dan tersebar di internet. Hasilnya dilaporkan sebagai persentase pertanyaan yang dijawab dengan benar.

Selengkapnya
Contoh
Sebuah soal khas mengajukan pertanyaan yang jawaban faktual singkatnya — sebuah nama, tanggal, atau angka — terkubur jauh di web dan menuntut pencarian gigih bertahap melintasi banyak halaman.
Penilaian
Metriknya adalah akurasi (accuracy): persentase pertanyaan yang jawaban agennya cocok dengan satu-satunya jawaban benar yang diketahui.
Verifikasi
Sebuah jawaban diterima bila cocok dengan jawaban acuan yang sudah ditetapkan (gaya kecocokan persis); pertanyaan dirancang agar jawabannya sulit ditemukan tetapi mudah diverifikasi setelah diberikan.
Mengapa penting
Ia menguji kemampuan yang tidak dimiliki chatbot biasa — riset web yang mendalam dan gigih dalam banyak langkah — sehingga tetap menjadi ujian berat bagi penjelajahan agentik bahkan untuk model yang kuat.
Contoh penyelesaian
Tugas
Butir BrowseComp: «Sebutkan sebuah film layar lebar yang dirilis antara 2010 dan 2015 yang (1) memenangkan Academy Award untuk Film Terbaik, (2) mendramatisasi satu operasi penyelamatan rahasia, (3) disutradarai oleh orang yang sama yang memerankan tokoh utama, dan (4) mencapai klimaksnya di sebuah bandara di Teheran. Berikan judul filmnya saja.»
Solusi
Semua kendala bertemu pada satu film — pemenang Academy Award Film Terbaik periode 2010–2015 yang merupakan drama penyelamatan rahasia yang disutradarai oleh pemeran utamanya sendiri dan klimaksnya di bandara Teheran. Jawaban akhir: Argo (2012), disutradarai dan dibintangi oleh Ben Affleck.
Penjelasan
Setiap petunjuk mempersempit kandidat — pemenang Film Terbaik pada 2010–2015, lalu drama penyelamatan yang disutradarai pemeran utamanya, dan terakhir yang klimaksnya di bandara Teheran — menyisakan hanya Argo, yang disutradarai sekaligus dibintangi Ben Affleck. BrowseComp membandingkan jawaban teks bebas yang singkat dengan referensi melalui pencocokan persis atau yang diperiksa model, sehingga «Argo» dinilai benar.
0 24.5 49 73.5 98 2025-04-10 2025-12-11 2026-08-13 GLM-4.5 · 26.4 · 2025-08-06 Tongyi DeepResearch · 43.4 · 2025-09-16 Kimi K2 Thinking · 60.2 · 2025-11-07 MiroThinker v1.0 (72B variant) · 47.1 · 2025-11-14 Kimi K2.5 · 74.9 · 2026-01-27 Claude Opus 4.6 · 84 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-02-05 Claude Opus 4.6 · 83.7 · 2026-03-06 Step 3.5 Flash · 69 · 2026-02-10 Qwen3.5-397B-A17B · 78.6 · 2026-02-16 Opus 4.6 · 84 · 2026-04-21 GPT-5.4 · 82.7 · 2026-04-21 GPT-5.4 Pro · 89.3 · 2026-04-21 Gemini 3.1 Pro · 85.9 · 2026-04-23 GPT-5.5 · 84.4 · 2026-04-23 Agents-A1 · 75.5 · 2026-07-06 GPT-5.6 Sol · 92.2 · 2026-07-09 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Mach-Mind-4-Flash · 72.3 · 2026-07-13 Qwen3-4B · 35.6 · 2026-07-16 Qwen3-30B-A3B · 42.6 · 2026-07-16 GPT-Live-1 · 75.2 · 2026-07-17 Kimi K3 · 91.2 · 2026-07-17 GPT-5.6 Luna (Extra High) · 84.0 · 2026-08-13 GPT-5.5 (Extra High) · 84.4 · 2026-08-13 OpenAI Deep Research · 51.5 · 2025-04-10
GLM-4.5 Tongyi DeepResearch Kimi K2 Thinking MiroThinker v1.0 (72B variant) Kimi K2.5 Claude Opus 4.6 Step 3.5 Flash Qwen3.5-397B-A17B Opus 4.6 GPT-5.4 GPT-5.4 Pro Gemini 3.1 Pro GPT-5.5 Agents-A1 GPT-5.6 Sol Mach-Mind-4-Flash Qwen3-4B Qwen3-30B-A3B GPT-Live-1 Kimi K3 GPT-5.6 Luna (Extra High) GPT-5.5 (Extra High) OpenAI Deep Research
Linimasa
Tanggal Model Skor Sumber
2026-08-13 GPT-5.6 Luna (Extra High) 84.04% OpenAI merilis GPT-5.6 untuk alur kerja agen yang terjangkau dan berkinerja tinggi
2026-08-13 GPT-5.5 (Extra High) 84.36% OpenAI merilis GPT-5.6 untuk alur kerja agen yang terjangkau dan berkinerja tinggi
2026-07-17 Kimi K3 91.2% Moonshot AI merilis Kimi K3 terbuka, model MoE 2,8T parameter dengan konteks 1M
2026-07-17 GPT-Live-1 75.2% OpenAI merilis model suara full-duplex dan pengadilan Jerman menjatuhkan tanggung jawab kepada Google untuk Ringkasan AI
2026-07-16 Qwen3-4B 35.6% TRACE meningkatkan penggunaan alat agen jangka panjang melalui estimasi kredit per giliran
2026-07-16 Qwen3-30B-A3B 42.6% TRACE meningkatkan penggunaan alat agen jangka panjang melalui estimasi kredit per giliran
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: Model agentic MoE 35B menyamai model yang lebih besar melalui optimasi pasca-pelatihan
2026-07-13 Mach-Mind-4-Flash 72.31% Mach-Mind-4-Flash: Model agentic MoE 35B menyamai model lebih besar melalui optimisasi pasca-pelatihan
2026-07-09 GPT-5.6 Sol 92.2% OpenAI meluncurkan keluarga GPT-5.6 dengan model Sol, Terra, dan Luna
2026-07-06 Agents-A1 75.5pts Memperluas Horizon, Bukan Parameter: Mencapai Kinerja Triliun-Parameter dengan Agen 35B
2026-04-23 Gemini 3.1 Pro 85.9% OpenAI merilis GPT-5.5 dengan kemampuan agentic dan penggandaan harga API
2026-04-23 GPT-5.5 84.4% OpenAI merilis GPT-5.5 dengan kemampuan agentic dan penggandaan harga API
2026-04-21 Opus 4.6 84.0% Google meluncurkan agen Deep Research dan Deep Research Max yang dibangun di atas Gemini 3.1 Pro
2026-04-21 GPT-5.4 82.7% Google meluncurkan agen Deep Research dan Deep Research Max yang dibangun di atas Gemini 3.1 Pro
2026-04-21 GPT-5.4 Pro 89.3% Google meluncurkan agen Deep Research dan Deep Research Max yang dibangun di atas Gemini 3.1 Pro
2026-03-06 Claude Opus 4.6 83.73% Anthropic merilis kartu sistem Claude Opus 4.6 yang merinci kemampuan dan penilaian keamanan
2026-02-16 Qwen3.5-397B-A17B 78.6% Qwen merilis model Qwen3.5-397B-A17B yang dikuantisasi FP8
2026-02-10 Step 3.5 Flash 69.0% Langkah 3.5 Flash: model MoE aktif 11B mencapai kinerja agentic tingkat terdepan
2026-02-05 Claude Opus 4.6 84.0% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2026-02-05 Claude Opus 4.6 83.73% Anthropic menerbitkan kartu sistem Claude Opus 4.6 yang merinci kemampuan dan evaluasi keamanan
2026-01-27 Kimi K2.5 74.9% Moonshot merilis Kimi K2.5 dengan teknologi Agent Swarm
2025-11-14 MiroThinker v1.0 (72B variant) 47.1% MiroThinker v1.0 memperkenalkan skala interaktif untuk agen riset sumber terbuka
2025-11-07 Kimi K2 Thinking 60.2% Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter
2025-09-16 Tongyi DeepResearch 43.4% Tongyi merilis DeepResearch, agen web open-source yang menyamai kinerja proprietary
2025-08-06 GLM-4.5 26.4% Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek
2025-04-10 OpenAI Deep Research 51.5% OpenAI