Benchmark · reasoning

GPQA Diamond

61 hasil 44 model

GPQA Diamond adalah subset tersulit dari GPQA, kumpulan soal pilihan ganda tingkat pascasarjana dan "anti-Google" di bidang biologi, fisika, dan kimia yang ditulis oleh para ahli. Model dinilai berdasarkan persentase akurasi dalam memilih jawaban yang benar.

Selengkapnya
Contoh
Soal yang khas adalah pertanyaan pilihan ganda sulit yang menuntut penalaran tingkat pascasarjana; misalnya, soal kimia yang menjelaskan suatu mekanisme reaksi dan menanyakan mana dari empat pilihan yang menghasilkan produk yang benar, begitu sulit sampai orang non-ahli pun tak bisa menjawabnya meski memakai pencarian web.
Penilaian
Skornya adalah persentase soal yang dijawab benar (akurasi): jumlah soal saat model memilih opsi yang benar dibagi total jumlah soal.
Verifikasi
Setiap jawaban dinilai secara otomatis melalui pencocokan persis dengan satu-satunya opsi benar yang diketahui, sehingga tidak perlu penilaian manusia; label "Diamond" itu sendiri diberikan saat pembuatan dataset, yaitu ketika para ahli yang berkualifikasi sepakat pada jawaban sementara non-ahli tetap salah.
Mengapa penting
Ini salah satu ujian paling berat untuk penalaran ilmiah tingkat ahli yang sesungguhnya (bukan fakta yang bisa dicari), sehingga skor tinggi di GPQA Diamond menjadi sinyal penting bahwa model terdepan mampu bernalar pada masalah yang sulit dan spesialistis.
Contoh penyelesaian
Tugas
Sebuah elektron berada dalam keadaan spin (tak ternormalisasi) (3i, 4)ᵀ. Tentukan nilai harap spinnya sepanjang sumbu y, S_y. Pilihan: (A) 12ħ/25 (B) −12ħ/25 (C) 25ħ/2 (D) −25ħ/2.
Solusi
Norm: |3i|²+|4|²=25. σ_y=[[0,−i],[i,0]]. ⟨S_y⟩=(ħ/2)·(ψ†σ_yψ)/(ψ†ψ)=(ħ/2)·(−24/25)=−12ħ/25 → (B).
Penjelasan
Dengan ⟨S_y⟩ = ψ†S_yψ / ψ†ψ dan S_y = (ħ/2)σ_y, pembilang ψ†σ_yψ = −24 dan normanya ψ†ψ = 25, sehingga menghasilkan −12ħ/25 (pilihan B). GPQA menilai berdasarkan kecocokan persis huruf yang dipilih dengan kunci jawaban.
0 25 50 75 100 2023-11-20 2025-03-27 2026-08-03 GPT-4 based baseline · 39 · 2023-11-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 59.4 · 2024-06-20 Claude 3.5 Sonnet · 65 · 2025-02-26 Qwen2-72B · 37.9 · 2024-07-15 Qwen2-72B · 37.9 · 2024-07-15 QwQ-32B-Preview · 65.2 · 2024-11-28 o3 · 87.7 · 2024-12-20 o3 · 87.7 · 2026-03-25 Grok 3 (Think) · 84.6 · 2025-02-19 Claude 3.7 Sonnet · 84.8 · 2025-02-24 Claude 3.7 Sonnet · 84.8 · 2025-02-26 Grok 3 Beta · 84.6 · 2025-02-26 DeepSeek R1 · 71.5 · 2025-02-26 OpenAI o3-mini · 78 · 2025-02-26 GPT-4.5 · 71.4 · 2025-03-05 Grok 3 · 84.6 · 2025-03-11 DeepSeek-V3-0324 · 68.4 · 2025-03-24 Gemini 2.5 Pro (experimental) · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-25 Gemini 2.5 Pro · 84 · 2025-03-26 Gemini 2.5 Pro · 84 · 2025-04-05 Seed1.5-Thinking · 77.3 · 2025-04-10 GPT‑4.1 nano · 50.3 · 2025-04-14 Gemini 2.0 Flash · 60.1 · 2025-04-15 Claude Sonnet 4 · 70 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Claude Opus 4 · 74.9 · 2025-05-22 Deepseek-R1-0528 · 81 · 2025-05-30 Kimi K2 · 75.1 · 2025-07-28 Kimi K2 · 75.1 · 2025-07-28 GPT-5 pro · 88.4 · 2025-08-07 GPT-5 pro · 89.4 · 2025-08-07 GPT-5 Pro · 88.4 · 2025-08-07 DeepSeek-V3.1-Terminus · 74.2 · 2025-09-22 Claude Sonnet 4.5 · 83.4 · 2025-09-30 GPT-5.2 · 92.4 · 2025-10-24 GPT-4 · 39 · 2025-10-24 Claude 3 Opus · 60 · 2025-10-24 O1 · 77 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2025-10-24 Claude Opus 4.6 · 91.3 · 2026-02-05 Gemini 3 Pro · 91.9 · 2025-10-24 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 91.9 · 2025-11-18 Gemini 3 Pro · 93 · 2025-12-04 Gemini 3.1 Pro Preview · 94.1 · 2025-10-24 Aristotle-X1 · 92.4 · 2025-10-24 Gemini 3 Deep Think · 93.8 · 2025-11-18 Gemini 3 Deep Think · 93.8 · 2025-11-18 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Thinking · 92.4 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 GPT-5.2 Pro · 93.2 · 2025-12-11 Kimi K2.5 · 87.6 · 2026-01-27 Grok 4 · 87.7 · 2026-02-25 GPT-Live-1 · 84.2 · 2026-07-17 Kimi K3 · 93.5 · 2026-07-17 Inkling-Small · 89.5 · 2026-08-03 Qwen3.8-Max · 92.6 · 2026-08-03 OpenAI o3 · 87.7 · 2025-04-16
GPT-4 based baseline Claude 3.5 Sonnet Qwen2-72B QwQ-32B-Preview o3 Grok 3 (Think) Claude 3.7 Sonnet Grok 3 Beta DeepSeek R1 OpenAI o3-mini GPT-4.5 Grok 3 DeepSeek-V3-0324 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Seed1.5-Thinking GPT‑4.1 nano Gemini 2.0 Flash Claude Sonnet 4 Claude Opus 4 Deepseek-R1-0528 Kimi K2 GPT-5 pro GPT-5 Pro DeepSeek-V3.1-Terminus Claude Sonnet 4.5 GPT-5.2 GPT-4 Claude 3 Opus O1 Claude Opus 4.6 Gemini 3 Pro Gemini 3.1 Pro Preview Aristotle-X1 Gemini 3 Deep Think GPT-5.2 Thinking GPT-5.2 Pro Kimi K2.5 Grok 4 GPT-Live-1 Kimi K3 Inkling-Small Qwen3.8-Max OpenAI o3
Linimasa
Tanggal Model Skor Sumber
2026-08-03 Qwen3.8-Max 92.6% Alibaba merilis Qwen3.8-Max, model MoE dengan 2,4 triliun parameter
2026-08-03 Inkling-Small 89.5% Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
2026-07-17 Kimi K3 93.5% Moonshot AI merilis Kimi K3 terbuka, model MoE 2,8T parameter dengan konteks 1M
2026-07-17 GPT-Live-1 84.2% OpenAI merilis model suara full-duplex dan pengadilan Jerman menjatuhkan tanggung jawab kepada Google untuk Ringkasan AI
2026-03-25 o3 87.7% OpenAI mengumumkan pensiunnya o3 dari ChatGPT dan membagikan skor benchmark
2026-02-25 Grok 4 87.7% xAI merilis model penalaran Grok 4 dengan benchmark agentic dan coding yang kuat
2026-02-05 Claude Opus 4.6 91.3% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2026-01-27 Kimi K2.5 87.6% Moonshot merilis Kimi K2.5 dengan teknologi Agent Swarm
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
2025-12-11 GPT-5.2 Thinking 92.4% OpenAI merilis model GPT-5.2 Pro dan Thinking untuk sains dan matematika
2025-12-11 GPT-5.2 Pro 93.2% OpenAI merilis model GPT-5.2 Pro dan Thinking untuk sains dan matematika
2025-12-11 GPT-5.2 Pro 93.2% OpenAI memperkenalkan GPT-5.2 dengan kemampuan coding, konteks panjang, dan penalaran yang ditingkatkan
2025-12-04 Gemini 3 Pro 93.0% Epoch AI meluncurkan Hub Pusat Data Frontier dan menganalisis benchmark OSWorld
2025-11-18 Gemini 3 Pro 91.9% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Deep Think 93.8% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Pro 91.9% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Deep Think 93.8% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-10-24 GPT-5.2 92.4% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-10-24 GPT-4 39.0% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-10-24 Claude 3 Opus 60.0% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-10-24 O1 77.0% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-10-24 Claude Opus 4.6 91.3% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-10-24 Gemini 3 Pro 91.9% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-10-24 Gemini 3.1 Pro Preview 94.1% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-10-24 Aristotle-X1 92.4% Benchmark GPQA-Diamond: Skor, Papan Peringkat & Perbandingan Model AI
2025-09-30 Claude Sonnet 4.5 83.4% Anthropic merilis Claude Sonnet 4.5 dengan kemampuan coding dan agen yang ditingkatkan
2025-09-22 DeepSeek-V3.1-Terminus 74.24% DeepSeek merilis DeepSeek-V3.1-Terminus dengan perbaikan bahasa dan agen
2025-08-07 GPT-5 pro 88.4% OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli
2025-08-07 GPT-5 Pro 88.4% OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu
2025-08-07 GPT-5 pro 89.4% OpenAI meluncurkan GPT-5 terpadu dengan penataan rute waktu nyata dan akses gratis
2025-07-28 Kimi K2 75.1% Kimi K2: model MoE terbuka dengan 1T parameter dan pengoptimal MuonClip
2025-07-28 Kimi K2 75.1% Moonshot merilis Kimi K2, model MoE agentic terbuka dengan 32B parameter aktif
2025-05-30 Deepseek-R1-0528 81.0% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-05-22 Claude Sonnet 4 70.0% Anthropic memperkenalkan Claude Opus 4 dan Sonnet 4 dengan pemikiran ekstensif dan penggunaan alat
2025-05-22 Claude Opus 4 74.9% Anthropic merilis Claude Opus 4 dan Sonnet 4 dengan langkah keamanan ASL-3
2025-05-22 Claude Opus 4 74.9% Anthropic memperkenalkan Claude Opus 4 dan Sonnet 4 dengan pemikiran ekstensif dan penggunaan alat
2025-04-16 OpenAI o3 87.7% OpenAI
2025-04-15 Gemini 2.0 Flash 60.1% Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 50.3% OpenAI meluncurkan GPT-4.1, GPT-4.1 mini, dan GPT-4.1 nano di API
2025-04-10 Seed1.5-Thinking 77.3% Seed1.5-Thinking menggunakan pembelajaran penguatan untuk meningkatkan penalaran
2025-04-05 Gemini 2.5 Pro 84.0% Google memperluas akses ke Gemini 2.5 Pro di tengah hasil benchmark yang kuat
2025-03-26 Gemini 2.5 Pro 84.0% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2025-03-25 Gemini 2.5 Pro (experimental) 84.0% Google DeepMind merilis model eksperimen Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 84.0% Google DeepMind
2025-03-24 DeepSeek-V3-0324 68.4% DeepSeek-V3-0324 meningkatkan kemampuan penalaran, pemrograman, dan penulisan bahasa Mandarin dibandingkan DeepSeek-V3
2025-03-11 Grok 3 84.6% xAI merilis Grok 3 dengan penalaran mendalam dan konteks jutaan token
2025-03-05 GPT-4.5 71.4% OpenAI merilis GPT-4.5, model terbesarnya, untuk ChatGPT Plus
2025-02-26 Claude 3.7 Sonnet 84.8% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 Grok 3 Beta 84.6% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 DeepSeek R1 71.5% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 OpenAI o3-mini 78.0% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 65.0% Perbandingan benchmark Claude 3.7 Sonnet, o3-mini, R1, dan Grok 3 Beta
2025-02-24 Claude 3.7 Sonnet 84.8% Anthropic merilis Claude 3.7 Sonnet dengan kontrol penalaran dinamis
2025-02-19 Grok 3 (Think) 84.6% xAI merilis Grok 3 Beta dan agen DeepSearch
2024-12-20 o3 87.7% OpenAI merilis model o3 dengan kinerja tinggi dalam penalaran dan pemrograman
2024-11-28 QwQ-32B-Preview 65.2% Qwen merilis QwQ-32B-Preview, model penalaran eksperimental
2024-07-15 Qwen2-72B 37.9% Tim Qwen merilis seri Qwen2 dengan model padat dan MoE 72B
2024-07-15 Qwen2-72B 37.9% Laporan Teknis Qwen2 memperkenalkan model padat dan MoE hingga 72B
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi
2024-06-20 Claude 3.5 Sonnet 59.4% Anthropic
2023-11-20 GPT-4 based baseline 39.0% GPQA: Benchmark Q&A Tingkat Pascasarjana yang Tahan Google