| 2026-08-03 |
Qwen3.8-Max |
92.6% |
阿里巴巴发布Qwen3.8-Max,一款拥有2.4万亿参数的MoE模型
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
|
| 2026-07-17 |
Kimi K3 |
93.5% |
月之暗面发布开源 Kimi K3,拥有 2.8T 参数和 100 万上下文的 MoE 模型
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI 发布全双工语音模型,德国法院判定谷歌对 AI 概览内容承担责任
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI 宣布从 ChatGPT 中退役 o3 并分享基准测试分数
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI 发布 Grok 4 推理模型,在智能体和编码基准测试中表现强劲
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot发布搭载Agent Swarm技术的Kimi K2.5
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI 推出 GPT-5.2,具备改进的代码编写、长上下文和推理能力
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI 发布 GPT-5.2 Pro 和 Thinking 模型,助力科学与数学
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI 发布 GPT-5.2 Pro 和 Thinking 模型,助力科学与数学
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI 推出 GPT-5.2,具备改进的代码编写、长上下文和推理能力
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI 推出前沿数据中心中心并分析 OSWorld 基准
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-10-24 |
GPT-4 |
39.0% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-10-24 |
O1 |
77.0% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
GPQA-Diamond 基准:分数、排行榜及 AI 模型对比
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic 发布 Claude Sonnet 4.5,增强编码与智能体能力
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek发布DeepSeek-V3.1-Terminus,修复语言和代理问题
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI 推出 GPT-5,具备统一路由与专家级推理能力
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAI 发布具备自适应推理与统一架构的 GPT-5
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI 推出统一版 GPT-5,支持实时路由并提供免费访问
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2:拥有1T参数和MuonClip优化器的开源MoE模型
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot发布Kimi K2,一款拥有32B激活参数的开放智能体MoE模型
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek更新R1模型,提升推理能力与基准测试成绩
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
Anthropic 推出支持扩展思考与工具使用的 Claude Opus 4 和 Sonnet 4
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic发布Claude Opus 4和Sonnet 4,配备ASL-3安全措施
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic 推出支持扩展思考与工具使用的 Claude Opus 4 和 Sonnet 4
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI在API中推出GPT-4.1、GPT-4.1 mini和GPT-4.1 nano
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking 使用强化学习提升推理能力
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
Google在强劲基准测试结果推动下扩大Gemini 2.5 Pro访问权限
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
Google 发布实验性 Gemini 2.5 Pro 推理模型,支持 100 万 token 上下文
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind 发布 Gemini 2.5 Pro 实验模型
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 在推理、编码和中文写作方面优于 DeepSeek-V3
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI发布具有深度推理和百万token上下文的Grok 3
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Claude 3.7 Sonnet、o3-mini、R1 和 Grok 3 Beta 的基准测试对比
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI发布Grok 3 Beta版和DeepSearch智能体
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI 发布 o3 模型,在推理和编程方面表现卓越
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen发布QwQ-32B-Preview,一款实验性推理模型
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA:研究生级别的防Google问答基准
|