| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
Google Research、AIエージェントのハーネス過学習を防ぐRRSIを公開
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
ISTAがQwen3.8-Flash-Nextおよび50%专家プルーニング済みCoderビルド向けにGSQ-RCO GGUFをリリース
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
ROFTは自己生成された説明でのファインチューニングによりエージェントモデルを改善する
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AIが、トークン使用量を40%削減したポストトレーニング済みのKimi K3「Ember-1」をリリース
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCriticはロール固有のRLを用いてテスト誘導のリペアによりコーディングエージェントを改善する
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCriticはロール固有のRLを用いてテスト誘導のリペアによりコーディングエージェントを改善する
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCriticはロール固有のRLを用いてテスト誘導のリペアによりコーディングエージェントを改善する
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCriticはロール固有のRLを用いてテスト誘導のリペアによりコーディングエージェントを改善する
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCriticはロール固有のRLを用いてテスト誘導のリペアによりコーディングエージェントを改善する
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCriticは役割固有のRLを用いてテスト誘導型修正によりコーディングエージェントを改善する
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCriticは役割固有のRLを用いてテスト誘導型修正によりコーディングエージェントを改善する
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCriticは役割固有のRLを用いてテスト誘導型修正によりコーディングエージェントを改善する
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCriticは役割固有のRLを用いてテスト誘導型修正によりコーディングエージェントを改善する
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCriticは役割固有のRLを用いてテスト誘導型修正によりコーディングエージェントを改善する
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFMがK2 Horizonをリリース:0.9Bから375Bまでの6つのApache 2.0モデル
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFMがK2 Horizonをリリース:0.9Bから375Bまでの6つのApache 2.0モデル
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPYがQwen3-14BのAppWorldでの首位獲得を成果のみによる強化学習で実現
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM、オープンエンタープライズモデル向けにネイティブ推論とエージェント型強化学習を備えたGranite 4.2をリリース
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM、オープンエンタープライズモデル向けにネイティブ推論とエージェント型強化学習を備えたGranite 4.2をリリース
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
MetaがMuse Videoをネイティブ音声付きでリリース;StripeがOpenRouterを買収
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.aiがポストトレーニングのスケーリング法を提案しGLM 5.3をリリース、Ornith-1.5が自己改善機能で登場
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5が自己改善トレーニングを用いた9B、35B-A3B、397Bモデルをリリース
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
Kozuchi AgentがQwen3.5-27Bを使用してSWE-bench Verifiedの374インスタンスを解決
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Metaが30Bのオープンウェイトエージェントモデル「Muse Glimmer」を1枚のコンシューマーGPUで動作可能として公開
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
Microsoft Research、スケーラブルなエージェント型AI向けのOrchardフレームワークをリリース
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropicがデフォルトの思考機能とエージェント型コーディングの向上を備えたClaude Opus 5をリリース
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
ベンチマーク、ライセンス、推論コストで比較されるKimi K3、DeepSeek V4 Pro、GLM-5.2
|
| 2026-07-17 |
Devstral 2 |
72.2% |
コード用Mistral VibeがスキャフォールドからPRまでのタスクで4つのコーディングエージェントをリード
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
コード用Mistral VibeがスキャフォールドからPRまでのタスクで4つのコーディングエージェントをリード
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoEがMoEのエキスパートプールを再配置し、ドメイン固有のファインチューニングを改善
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoEがMoEのエキスパートプールを再配置し、ドメイン固有のファインチューニングを改善
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifierが継続的スコアリングによる汎用検証フレームワークを導入
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
アリババ、Qwen3.6-27Bをリリース、コーディングベンチマークでより大きな後継モデルを上回る
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek、エージェント向けに効率的な長期コンテキストアーキテクチャを搭載したV4をリリース
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI、ChatGPTからo3の退役を発表しベンチマークスコアを公開
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropicがコーディング、コンピュータ操作、100万トークンコンテキストを改善したClaude Sonnet 4.6をリリース
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
デコンタミネーション済みベンチマークが示すトップAIコーディングモデル間の12ポイントの格差
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
デコンタミネーション済みベンチマークが示すトップAIコーディングモデル間の12ポイントの格差
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27BとDeepSeek V4 Flashがローカルコーディングベンチマークで首位
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAIがGPT-5.2をリリース、コーディングおよび推論ベンチマークでGemini 3を上回る
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAIがGPT-5.2を発表、プロフェッショナルな知識作業の最先端能力を搭載
|
| 2025-12-09 |
Devstral 2 |
72.2% |
MistralがDevstral 2コーディングモデルとMistral Vibe CLIをリリース
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
MistralがDevstral 2コーディングモデルとMistral Vibe CLIをリリース
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI、Codex CLIのデフォルトにGPT-5.1-Codex-Maxを採用
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AIがエージェント型ツール利用を備えたKimi K2 Thinkingをリリース
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AIがKimi K2 Thinkingをリリース、オープンソースの1Tパラメータ推論モデル
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
AnthropicがClaude Sonnet 4.5をリリース、コーディングとエージェント機能が強化
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAIがリアルタイムルーティングと無料アクセスを備えた統合GPT-5を発表
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAIがコーディングおよびエージェント機能の改善されたGPT-5 APIをリリース
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAIが統一ルーティングと専門レベルの推論を備えたGPT-5を発表
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
智譜AIがClaudeやDeepSeekに匹敵するGLM-4.5モデルをリリース
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshotが32Bの活性化パラメータを持つオープンなエージェント型MoEモデル「Kimi K2」をリリース
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2: 1兆パラメータのオープンなMoEモデルとMuonClipオプティマイザ
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI、エージェント機能を持つ1TパラメータのMoEモデル「Kimi-K2-Instruct」をリリース
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI、エージェント機能を持つ1TパラメータのMoEモデル「Kimi K2」をリリース
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI、All Hands AIと共同でDevstral Small 1.1およびDevstral Mediumをリリース
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI、All Hands AIと共同でDevstral Small 1.1およびDevstral Mediumをリリース
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeekがR1モデルを更新し、推論能力とベンチマークスコアを向上
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropicがハイブリッド推論機能を備えたClaude Opus 4およびSonnet 4をリリース
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropicがハイブリッド推論機能を備えたClaude Opus 4およびSonnet 4をリリース
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI、ソフトウェアエンジニアリング向けエージェント型LLM「Devstral」をリリース
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAIが高速で低コストなマルチモーダル推論モデルo4-miniをリリース
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAIが100万トークンのコンテキストとコーディング改善を備えたGPT-4.1ファミリーをリリース
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAIがAPIでGPT-4.1、GPT-4.1 mini、GPT-4.1 nanoをリリース
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
Googleが100万トークンコンテキストを備えた実験的なGemini 2.5 Pro推論モデルをリリース
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Googleが実験的モデルGemini 2.5 Proを発表
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
GoogleがGemini 2.5 Pro思考モデルを発表
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI、ChatGPT Plus向けに最大規模モデルGPT-4.5をリリース
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 SonnetがSWE-bench Verifiedで49%を達成
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI、推論とコーディングで高性能なモデルo3をリリース
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI、ARC AGIおよびFrontier Mathでの突破を示すo3推論モデルをプレビュー
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnetが最小限のエージェント支援でSWE-bench Verifiedで49%を達成
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
AnthropicがClaude 3.5 Sonnetをアップグレード、Claude 3.5 Haikuとコンピュータ操作ベータ版をリリース
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
AnthropicがClaude 3.5 Sonnetをアップグレード、Claude 3.5 Haikuとコンピュータ操作ベータ版をリリース
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAIがSWE-bench Verifiedを公開、人間検証済みサブセット付き
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAIがSWE-bench Verifiedを公開、人間検証済みサブセット付き
|