| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeekがネイティブマルチモーダルサポートを備えたV4.1-Flashモデルをリリース
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFMがK2 Horizonをリリース:0.9Bから375Bまでの6つのApache 2.0モデル
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFMがK2 Horizonをリリース:0.9Bから375Bまでの6つのApache 2.0モデル
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta、ツール呼び出しとトークンを削減した Muse Spark 1.3 をリリース
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM、オープンエンタープライズモデル向けにネイティブ推論とエージェント型強化学習を備えたGranite 4.2をリリース
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM、オープンエンタープライズモデル向けにネイティブ推論とエージェント型強化学習を備えたGranite 4.2をリリース
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAIがエージェントワーク向けにCursorデータを搭載したGrok 4.6を発表
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeekがマルチモーダルモデル DeepSeek-V4-Flash-Vision-Exp をリリース
|
| 2026-08-20 |
agents |
94.0% |
MetaがMuse Videoをネイティブ音声付きでリリース;StripeがOpenRouterを買収
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5が自己改善トレーニングを用いた9B、35B-A3B、397Bモデルをリリース
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
DeepSeek-V4-Pro GAリリースでエージェント機能が強化され、Responses APIサポートが追加
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAIがGrok 4.6をリリース;AlibabaがQwen3.8-MoEを公開;DeepSeek V4 Pro GA
|
| 2026-08-11 |
Opus 5 |
86.74% |
自己進化型エージェントOuroborosがOpus 5で新ベンチマークを樹立
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Metaが30Bのオープンウェイトエージェントモデル「Muse Glimmer」を1枚のコンシューマーGPUで動作可能として公開
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731 が公開ハーネスで Terminal-Bench 2.1 に 82.7% を達成
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AIが境界内デプロイメント向けの10Mトークンコンテキストモデル「Pokee-Isaac 28B」をリリース
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeekがV4-Flash-0731をリリース、低コストでV4-Proを上回る性能
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
MetaがMuse Spark 1.2を搭載したMuse Codeベータ版ターミナルエージェントをリリース
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
アリババ、2.4TパラメータのQwen3.8-Maxを発表し、間もなくオープンウェイトを公開
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
アリババが2.4兆パラメータのMoEモデル「Qwen3.8-Max」をリリース
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek、主要なポストトレーニングの改善とオープンウェイトを備えたV4-Flashをリリース
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeekがポストトレーニングの改善とオープンウェイトを備えたV4-Flashをリリース
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek、低コストでエージェント機能の大幅向上を実現したV4-Flash-0731をリリース
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek、エージェント機能を強化した「DeepSeek-V4-Flash」をパブリックベータで公開
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
Google、Gemini 3.6 Flash、3.5 Flash-Lite、および3.5 Flash Cyberをリリース
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
KwaiKATが10万件以上の検証可能な環境で学習したエージェント型コーディングモデル「KAT-Coder-V2.5」をリリース
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google、エージェントワークロード向けにGemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberをリリース
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google、Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberをリリース
|
| 2026-07-08 |
hermes |
55.0% |
ユーザーがMimo v2.5をDeepSeek V4 FlashおよびHermesと比較ベンチマーク
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAIが低コストでベンチマーク性能は混合のGrok 4.5をリリース
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifierが継続的スコアリングによる汎用検証フレームワークを導入
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8とFP8 KVによりTerminal-Bench 2.1で79.8%を達成
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
アリババ、Qwen3.6-27Bをリリース、コーディングベンチマークでより大きな後継モデルを上回る
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAIがGPT-5.5をリリース、ネイティブオムニモーダル処理を搭載したゼロからの再学習モデル
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAIがGPT-5.5をリリース、エージェント機能搭載とAPI価格の倍増
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAIがAPIでGPT-5.5およびGPT-5.5 Proをリリース
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMaxが自己進化型MoEモデルM2.7をオープンソース化、SWE-Proで56.22%のスコアを記録
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
ステップ3.5 Flash: 11BアクティブなMoEモデルが最前級のエージェント性能を実現
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI、Codex CLIのデフォルトにGPT-5.1-Codex-Maxを採用
|