Benchmark · general
SimpleQA
OpenAI's short-form factuality benchmark; accuracy in %.
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2026-08-03 | Inkling-Small | 20.6% | Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型 |
| 2025-04-15 | Gemini 2.0 Flash | 29.9% | Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍 |
| 2025-03-05 | GPT-4.5 | 62.5% | OpenAI发布GPT-4.5,其为ChatGPT Plus推出的最大模型 |
| 2024-10-30 | GPT-4o | 38.2% | OpenAI |