| 2026-08-03 |
Qwen3.8-Max |
92.6% |
アリババが2.4兆パラメータのMoEモデル「Qwen3.8-Max」をリリース
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース
|
| 2026-07-17 |
Kimi K3 |
93.5% |
Moonshot AIが2.8TパラメータのMoEモデル「Kimi K3」を1Mコンテキストで公開
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAIがフルデュプレックス音声モデルをリリース、ドイツの裁判所がGoogleにAIオーバビューの責任を課す
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI、ChatGPTからo3の退役を発表しベンチマークスコアを公開
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI、強力なエージェントおよびコーディングベンチマークを備えたGrok 4推論モデルをリリース
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshotがエージェントスワーム技術搭載のKimi K2.5をリリース
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI、コード記述・長文脈・推論能力を強化したGPT-5.2を発表
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAIが科学と数学向けにGPT-5.2 ProおよびThinkingモデルをリリース
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAIが科学と数学向けにGPT-5.2 ProおよびThinkingモデルをリリース
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI、コード記述・長文脈・推論能力を強化したGPT-5.2を発表
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AIがフロンティアデータセンターハブを立ち上げ、OSWorldベンチマークを分析
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-10-24 |
GPT-4 |
39.0% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-10-24 |
O1 |
77.0% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
GPQA-Diamondベンチマーク:スコア、リーダーボード、AIモデルの比較
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
AnthropicがClaude Sonnet 4.5をリリース、コーディングとエージェント機能が強化
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeekが言語およびエージェントの修正を施したDeepSeek-V3.1-Terminusをリリース
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAIが統一ルーティングと専門レベルの推論を備えたGPT-5を発表
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAIがリアルタイムルーティングと無料アクセスを備えた統合GPT-5を発表
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2: 1兆パラメータのオープンなMoEモデルとMuonClipオプティマイザ
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshotが32Bの活性化パラメータを持つオープンなエージェント型MoEモデル「Kimi K2」をリリース
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
AnthropicがClaude Opus 4とSonnet 4を、拡張思考とツール使用機能付きで発表
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
AnthropicがClaude Opus 4およびSonnet 4をASL-3の安全対策付きでリリース
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
AnthropicがClaude Opus 4とSonnet 4を、拡張思考とツール使用機能付きで発表
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
Google、Gemini 1.5 Proの2倍の速度と向上した品質を持つGemini 2.0 Flashをリリース
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAIがAPIでGPT-4.1、GPT-4.1 mini、GPT-4.1 nanoをリリース
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking は強化学習を用いて推論能力を向上させる
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
Google、強力なベンチマーク結果を背景にGemini 2.5 Proへのアクセスを拡大
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind、Gemini 2.5 Pro 実験モデルをリリース
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324は、DeepSeek-V3と比較して推論、コーディング、中国語の文章作成を改善
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAIが深層推論と100万トークンのコンテキストを持つGrok 3をリリース
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI、ChatGPT Plus向けに最大規模モデルGPT-4.5をリリース
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Claude 3.7 Sonnet、o3-mini、R1、Grok 3 Betaのベンチマーク比較
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropicが動的推論制御機能を備えたClaude 3.7 Sonnetをリリース
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAIがGrok 3 BetaとDeepSearchエージェントをリリース
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI、推論とコーディングで高性能なモデルo3をリリース
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwenが実験的推論モデル「QwQ-32B-Preview」をリリース
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwenチームが72BのDenseおよびMoEモデルを含むQwen2シリーズをリリース
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwen2技術レポートは72Bまでの密集型およびMoEモデルを紹介
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
AnthropicがClaude 3.5 Sonnetの補遺をリリースし、コーディングとビジョンベンチマークが改善
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: 大学院レベルのGoogle耐性Q&Aベンチマーク
|