Benchmark · reasoning

Humanity's Last Exam

32 hasil 24 model

Humanity's Last Exam (HLE) adalah benchmark berisi soal-soal tingkat pakar mutakhir yang mencakup banyak bidang (matematika, sains, humaniora, dan lainnya), yang sengaja dibuat sangat sulit bagi AI. Kinerjanya dilaporkan sebagai persentase ketepatan (accuracy).

Selengkapnya
Contoh
Setiap butir adalah pertanyaan pakar berjawaban tertutup dengan satu jawaban benar; misalnya soal matematika tingkat lanjut atau soal sains setara pascasarjana (sebagian disertai gambar), yang disajikan sebagai pilihan ganda atau jawaban singkat yang tepat.
Penilaian
Metriknya adalah ketepatan (accuracy), yaitu persentase soal yang dijawab benar oleh model. Beberapa versi juga melaporkan ukuran kalibrasi (tingkat keyakinan) di samping ketepatan.
Verifikasi
Setiap soal memiliki jawaban benar yang sudah diketahui, dan jawaban model dinilai secara otomatis terhadap acuan tersebut (opsi yang benar untuk pilihan ganda, jawaban singkat yang cocok) — penilaian otomatis dan objektif, bukan lewat pemungutan suara manusia.
Mengapa penting
Benchmark biasa sudah jenuh (model terbaik hampir menyentuh batas atas), sehingga HLE bertujuan menjadi ujian yang sulit dan membedakan di garis depan pengetahuan pakar manusia — tolok ukur yang bermakna tentang seberapa jauh AI dari penalaran setingkat pakar.
Contoh penyelesaian
Tugas
Burung kolibri (ordo Apodiformes) secara unik memiliki tulang sesamoid (sesamoid) oval berpasangan bilateral, yang tertanam di bagian kaudolateral aponeurosis (aponeurosis) berbentuk silang yang melebar pada insersi m. depressor caudae. Berapa banyak tendon (tendons) berpasangan yang ditopang oleh tulang sesamoid ini? Jawab dengan satu bilangan bulat.
Solusi
4
Penjelasan
Tulang sesamoid oval terbentuk di dalam aponeurosis berbentuk silang otot penurun ekor dan menopang empat tendon berpasangan dari insersi tersebut — sebuah osifikasi khusus yang unik pada anatomi ekor kolibri. HLE menilai jawaban melalui kecocokan persis antara bilangan bulat yang dikirim dengan jawaban acuan (4) dan secara terpisah meminta tingkat keyakinan untuk kalibrasi.
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
Linimasa
Tanggal Model Skor Sumber
2026-08-13 DeepSeek-V4-Pro 60.0% Rilis GA DeepSeek-V4-Pro meningkatkan kemampuan agen dan menambahkan dukungan API Respons
2026-08-03 Inkling-Small 31.6% Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
2026-07-23 PoTRE 49.92% PoTRE memperkenalkan kerangka kerja multi-agen heterogen untuk penalaran saat pengujian
2026-07-06 Agents-A1 47.6pts Memperluas Horizon, Bukan Parameter: Mencapai Kinerja Triliun-Parameter dengan Agen 35B
2026-07-01 Claude Opus 4.8 46.0% Anthropic merilis Claude Opus 4.8 dengan penalaran adaptif dan kejujuran yang ditingkatkan
2026-06-09 Claude Fable 5 53.0% Claude Fable 5 meluncur di peringkat #1 pada Indeks Kecerdasan Artificial Analysis
2026-04-25 Claude Opus 4.7 46.9% OpenAI merilis GPT-5.5, model yang dilatih ulang dari awal dengan pemrosesan omnimodal asli
2026-04-25 GPT-5.5 41.4% OpenAI merilis GPT-5.5, model yang dilatih ulang dari awal dengan pemrosesan omnimodal asli
2026-03-06 Claude Opus 4.6 53.0% Anthropic merilis kartu sistem Claude Opus 4.6 yang merinci kemampuan dan penilaian keamanan
2026-02-12 Gemini 3 Deep Think 48.4% Google merilis Gemini 3 Deep Think yang ditingkatkan dengan skor benchmark baru
2026-02-05 Claude Opus 4.6 53.0% Anthropic menerbitkan kartu sistem Claude Opus 4.6 yang merinci kemampuan dan evaluasi keamanan
2026-02-05 Claude Opus 4.6 40.0% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2026-01-29 Kimi K2.5 51.8% Moonshot merilis model agentic multimodal Kimi K2.5
2025-11-18 Gemini 3 Pro 37.5% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Deep Think 41.0% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Pro 37.5% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Deep Think 41.0% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0 memperkenalkan skala interaktif untuk agen riset sumber terbuka
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AI merilis Kimi K2 Thinking, model penalaran open-source 1T parameter
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeek merilis DeepSeek-V3.2-Exp dengan Sparse Attention untuk efisiensi konteks panjang
2025-09-16 Tongyi DeepResearch 32.9% Tongyi merilis DeepResearch, agen web open-source yang menyamai kinerja proprietary
2025-08-07 GPT-5 Pro 42.0% OpenAI meluncurkan GPT-5 terpadu dengan penataan rute waktu nyata dan akses gratis
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAI merilis Grok 4 dengan penguatan pembelajaran berskala dan penggunaan alat asli
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google memperluas akses ke Gemini 2.5 Pro di tengah hasil benchmark yang kuat
2025-03-26 Gemini 2.5 Pro 18.8% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind merilis model eksperimen Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google memperkenalkan model berpikir Gemini 2.5 Pro
2025-03-25 Gemini 2.5 Pro 18.8% Google memperkenalkan model eksperimental Gemini 2.5 Pro
2025-02-02 the model powering deep research 26.6% OpenAI luncurkan penelitian mendalam di ChatGPT sebagai kemampuan agentic
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam