ベンチマーク · reasoning

Humanity's Last Exam

32 結果 24 モデル

Humanity's Last Exam(HLE)は、数学・自然科学・人文学など多数の分野にわたる最先端で専門家レベルの問題からなるベンチマークで、AI にとって極めて難しくなるよう意図的に設計されています。性能は正答率(パーセント)で報告されます。

詳しく見る
各問題は答えが一つに定まる専門家レベルの問いで、たとえば高度な数学の問題や大学院レベルの科学の問題(画像が付くものもあります)を、多肢選択または厳密な短答の形式で出題します。
採点方法
指標は正答率(accuracy)で、モデルが正しく答えた問題の割合(パーセント)です。一部のバージョンでは、正答率とあわせてキャリブレーション(確信度)の指標も報告します。
検証方法
各問題には既知の正解があり、モデルの解答はその参照解と自動的に照合して採点されます(多肢選択なら正しい選択肢、短答なら一致するか)。人間の投票ではなく、客観的な自動採点です。
重要な理由
一般的なベンチマークは飽和し(トップモデルは上限近くに達し)ているため、HLE は人間の専門知識の最前線における難しく識別力の高いテストを目指しており、AI が専門家レベルの推論からどれだけ離れているかを測る意味のある指標となります。
解説付きの例
課題
ハチドリ(Apodiformes 目)は独自に、左右一対の卵形の種子骨(sesamoid)を持ち、これは m. depressor caudae(尾を下げる筋)の付着部にある拡大した十字形の腱膜(aponeurosis)の尾側外側部に埋め込まれている。この種子骨は何対の腱(tendons)を支えているか。整数一つで答えよ。
解答
4
解説
この卵形の種子骨は尾部下制筋の十字形腱膜の中で形成され、その付着部の4対の腱を支える――ハチドリの尾の解剖に特有の特殊化した骨化である。HLE は提出された整数を参照解答(4)と厳密一致で採点し、校正のために別途、確信度も取得する。
0 16 32 48 64 2025-01-23 2025-11-02 2026-08-13 the model powering deep research · 26.6 · 2025-02-02 Gemini 2.5 Pro (experimental) · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-25 Gemini 2.5 Pro · 18.8 · 2025-03-26 Gemini 2.5 Pro · 18.8 · 2025-04-05 Grok 4 Heavy · 50.7 · 2025-07-09 GPT-5 Pro · 42 · 2025-08-07 Tongyi DeepResearch · 32.9 · 2025-09-16 DeepSeek-V3.2-Exp · 56.5 · 2025-09-29 Kimi K2 Thinking · 44.9 · 2025-11-07 MiroThinker v1.0 (72B variant) · 37.7 · 2025-11-14 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Pro · 37.5 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 41 · 2025-11-18 Gemini 3 Deep Think · 48.4 · 2026-02-12 Kimi K2.5 · 51.8 · 2026-01-29 Claude Opus 4.6 · 53 · 2026-02-05 Claude Opus 4.6 · 40 · 2026-02-05 Claude Opus 4.6 · 53 · 2026-03-06 Claude Opus 4.7 · 46.9 · 2026-04-25 GPT-5.5 · 41.4 · 2026-04-25 Claude Fable 5 · 53 · 2026-06-09 Claude Opus 4.8 · 46 · 2026-07-01 Agents-A1 · 47.6 · 2026-07-06 PoTRE · 49.9 · 2026-07-23 Inkling-Small · 31.6 · 2026-08-03 DeepSeek-V4-Pro · 60 · 2026-08-13 DeepSeek R1 (text-only) · 9.4 · 2025-01-23 Grok 4 · 25.4 · 2025-07-09 GPT-5 · 24.8 · 2025-08-07
the model powering deep research Gemini 2.5 Pro (experimental) Gemini 2.5 Pro Grok 4 Heavy GPT-5 Pro Tongyi DeepResearch DeepSeek-V3.2-Exp Kimi K2 Thinking MiroThinker v1.0 (72B variant) Gemini 3 Pro Gemini 3 Deep Think Kimi K2.5 Claude Opus 4.6 Claude Opus 4.7 GPT-5.5 Claude Fable 5 Claude Opus 4.8 Agents-A1 PoTRE Inkling-Small DeepSeek-V4-Pro DeepSeek R1 (text-only) Grok 4 GPT-5
タイムライン
日付 モデル スコア ソース
2026-08-13 DeepSeek-V4-Pro 60.0% DeepSeek-V4-Pro GAリリースでエージェント機能が強化され、Responses APIサポートが追加
2026-08-03 Inkling-Small 31.6% Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース
2026-07-23 PoTRE 49.92% PoTREがテスト時の推論向けに異種マルチエージェントフレームワークを導入
2026-07-06 Agents-A1 47.6pts パラメータのスケールアップではなくホライゾンの拡張:35Bエージェントでトリリオン・パラメータ級のパフォーマンスを実現
2026-07-01 Claude Opus 4.8 46.0% Anthropicが適応的推論と改善された誠実性を備えたClaude Opus 4.8をリリース
2026-06-09 Claude Fable 5 53.0% Claude Fable 5がArtificial Analysisインテリジェンス指数で1位に登場
2026-04-25 Claude Opus 4.7 46.9% OpenAIがGPT-5.5をリリース、ネイティブオムニモーダル処理を搭載したゼロからの再学習モデル
2026-04-25 GPT-5.5 41.4% OpenAIがGPT-5.5をリリース、ネイティブオムニモーダル処理を搭載したゼロからの再学習モデル
2026-03-06 Claude Opus 4.6 53.0% AnthropicがClaude Opus 4.6のシステムカードを公開し、機能と安全性評価の詳細を明かす
2026-02-12 Gemini 3 Deep Think 48.4% Google、新しいベンチマークスコアを持つGemini 3 Deep Thinkをリリース
2026-02-05 Claude Opus 4.6 53.0% AnthropicがClaude Opus 4.6のシステムカードを公開し、能力と安全性評価の詳細を明記
2026-02-05 Claude Opus 4.6 40.0% Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
2026-01-29 Kimi K2.5 51.8% MoonshotがKimi K2.5マルチモーダルエージェントモデルをリリース
2025-11-18 Gemini 3 Pro 37.5% Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
2025-11-18 Gemini 3 Deep Think 41.0% GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
2025-11-18 Gemini 3 Pro 37.5% GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
2025-11-18 Gemini 3 Deep Think 41.0% Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
2025-11-14 MiroThinker v1.0 (72B variant) 37.7% MiroThinker v1.0がオープンソース研究エージェントのインタラクティブスケーリングを導入
2025-11-07 Kimi K2 Thinking 44.9% Moonshot AIがKimi K2 Thinkingをリリース、オープンソースの1Tパラメータ推論モデル
2025-09-29 DeepSeek-V3.2-Exp 56.53% DeepSeekが長文コンテキスト効率化のためのスパースアテンションを搭載したDeepSeek-V3.2-Expをリリース
2025-09-16 Tongyi DeepResearch 32.9% TongyiがProprietaryなパフォーマンスに匹敵するオープンソースのWebエージェントDeepResearchをリリース
2025-08-07 GPT-5 Pro 42.0% OpenAIがリアルタイムルーティングと無料アクセスを備えた統合GPT-5を発表
2025-08-07 GPT-5 24.8% OpenAI
2025-07-09 Grok 4 Heavy 50.7% xAIがスケーリングされた強化学習とネイティブツール利用を搭載したGrok 4をリリース
2025-07-09 Grok 4 25.4% xAI
2025-04-05 Gemini 2.5 Pro 18.8% Google、強力なベンチマーク結果を背景にGemini 2.5 Proへのアクセスを拡大
2025-03-26 Gemini 2.5 Pro 18.8% Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
2025-03-25 Gemini 2.5 Pro (experimental) 18.8% Google DeepMind、Gemini 2.5 Pro 実験モデルをリリース
2025-03-25 Gemini 2.5 Pro 18.8% GoogleがGemini 2.5 Pro思考モデルを発表
2025-03-25 Gemini 2.5 Pro 18.8% Googleが実験的モデルGemini 2.5 Proを発表
2025-02-02 the model powering deep research 26.6% OpenAIがChatGPTにエージェント型機能として「ディープリサーチ」をローンチ
2025-01-23 DeepSeek R1 (text-only) 9.4% Humanity's Last Exam