Benchmark · general
SimpleQA
OpenAI's short-form factuality benchmark; accuracy in %.
| Date | Model | Score | Source |
|---|---|---|---|
| 2026-08-03 | Inkling-Small | 20.6% | Thinking Machines Lab releases Inkling-Small, a 276B open weights multimodal MoE model |
| 2025-04-15 | Gemini 2.0 Flash | 29.9% | Google releases Gemini 2.0 Flash with enhanced quality and twice the speed of Gemini 1.5 Pro |
| 2025-03-05 | GPT-4.5 | 62.5% | OpenAI releases GPT-4.5, its largest model, for ChatGPT Plus |
| 2024-10-30 | GPT-4o | 38.2% | OpenAI |