| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeek发布具有原生多模态支持的V4.1-Flash模型
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFM发布K2 Horizon:六款Apache 2.0许可证模型,参数量从0.9B到375B
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFM发布K2 Horizon:六款Apache 2.0许可证模型,参数量从0.9B到375B
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta 发布 Muse Spark 1.3,减少工具调用和 token 数量
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM发布Granite 4.2,面向开放企业模型提供原生推理与代理式强化学习
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM发布Granite 4.2,面向开放企业模型提供原生推理与代理式强化学习
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAI 推出 Grok 4.6,提供 Cursor 数据以支持智能体工作
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp 多模态模型
|
| 2026-08-20 |
agents |
94.0% |
Meta发布原生音频支持的Muse Video;Stripe收购OpenRouter
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5 发布具有自我改进训练功能的 9B、35B-A3B 和 397B 模型
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
DeepSeek-V4-Pro GA 发布增强代理能力并添加 Responses API 支持
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAI发布Grok 4.6;阿里巴巴开源Qwen3.8-MoE;DeepSeek V4 Pro正式商用
|
| 2026-08-11 |
Opus 5 |
86.74% |
Ouroboros 自开发智能体使用 Opus 5 创下新基准记录
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Meta发布Muse Glimmer:一款在单张消费级GPU上运行的30B开源权重智能体模型
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731 在公开基准测试中于 Terminal-Bench 2.1 达到 82.7%
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AI 发布 Pokee-Isaac 28B,一款面向边界内部署的 10M token 上下文模型
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek 发布 V4-Flash-0731,以更低成本超越 V4-Pro
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
Meta发布由Muse Spark 1.2驱动的Muse Code beta版终端代理
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
阿里巴巴发布Qwen3.8-Max,拥有2.4T参数并即将开放权重
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
阿里巴巴发布Qwen3.8-Max,一款拥有2.4万亿参数的MoE模型
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek发布V4-Flash,带来重大训练后提升并开放权重
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeek发布V4-Flash,带来训练后增益与开源权重
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek 发布 V4-Flash-0731,以更低的成本实现显著的智能体能力提升
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek 发布 DeepSeek-V4-Flash 公测版,增强智能体能力
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
快手KAT发布KAT-Coder-V2.5,一种在10万多个可验证环境中训练的代理编程模型
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,面向智能体工作负载
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber
|
| 2026-07-08 |
hermes |
55.0% |
用户将 Mimo v2.5 与 DeepSeek V4 Flash 和 Hermes 进行基准测试对比
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAI发布Grok 4.5,成本低且基准测试表现参差不齐
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifier 引入具有连续评分的通用验证框架
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8 配合 FP8 KV 在 Terminal-Bench 2.1 上达到 79.8%
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
阿里巴巴发布Qwen3.6-27B,在编程基准测试中超越更大的前代模型
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI发布具备智能体能力的GPT-5.5,API定价翻倍
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI 通过 API 发布 GPT-5.5 和 GPT-5.5 Pro
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMax开源M2.7,一款在SWE-Pro上得分56.22%的自进化MoE模型
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
步骤 3.5 Flash:开源 11B 活跃参数的 MoE 模型达到前沿级代理性能
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI 将 GPT-5.1-Codex-Max 设为 Codex CLI 的默认模型
|