Бенчмарк · general
SimpleQA
OpenAI's short-form factuality benchmark; accuracy in %.
| Дата | Модель | Результат | Источник |
|---|---|---|---|
| 2026-08-03 | Inkling-Small | 20.6% | Thinking Machines Lab выпустила Inkling-Small: открытую мультимодальную MoE-модель с 276B весов |
| 2025-04-15 | Gemini 2.0 Flash | 29.9% | Google выпустила Gemini 2.0 Flash с улучшенным качеством и двукратной скоростью по сравнению с Gemini 1.5 Pro |
| 2025-03-05 | GPT-4.5 | 62.5% | OpenAI выпустила GPT-4.5, свою самую большую модель, для ChatGPT Plus |
| 2024-10-30 | GPT-4o | 38.2% | OpenAI |