Benchmark · general
SimpleQA
OpenAI's short-form factuality benchmark; accuracy in %.
| Fecha | Modelo | Puntuación | Fuente |
|---|---|---|---|
| 2026-08-03 | Inkling-Small | 20.6% | Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B |
| 2025-04-15 | Gemini 2.0 Flash | 29.9% | Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro |
| 2025-03-05 | GPT-4.5 | 62.5% | OpenAI lanza GPT-4.5, su modelo más grande, para ChatGPT Plus |
| 2024-10-30 | GPT-4o | 38.2% | OpenAI |