ベンチマーク · general
SimpleQA
OpenAI's short-form factuality benchmark; accuracy in %.
| 日付 | モデル | スコア | ソース |
|---|---|---|---|
| 2026-08-03 | Inkling-Small | 20.6% | Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース |
| 2025-04-15 | Gemini 2.0 Flash | 29.9% | Google、Gemini 1.5 Proの2倍の速度と向上した品質を持つGemini 2.0 Flashをリリース |
| 2025-03-05 | GPT-4.5 | 62.5% | OpenAI、ChatGPT Plus向けに最大規模モデルGPT-4.5をリリース |
| 2024-10-30 | GPT-4o | 38.2% | OpenAI |