Benchmark · general
SimpleQA
OpenAI's short-form factuality benchmark; accuracy in %.
| Tanggal | Model | Skor | Sumber |
|---|---|---|---|
| 2026-08-03 | Inkling-Small | 20.6% | Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B |
| 2025-04-15 | Gemini 2.0 Flash | 29.9% | Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro |
| 2025-03-05 | GPT-4.5 | 62.5% | OpenAI merilis GPT-4.5, model terbesarnya, untuk ChatGPT Plus |
| 2024-10-30 | GPT-4o | 38.2% | OpenAI |