Benchmark · general

SimpleQA

4 परिणाम 4 मॉडल

OpenAI's short-form factuality benchmark; accuracy in %.

0 16.5 33 49.5 66 2024-10-30 2025-09-16 2026-08-03 GPT-4.5 · 62.5 · 2025-03-05 Gemini 2.0 Flash · 29.9 · 2025-04-15 Inkling-Small · 20.6 · 2026-08-03 GPT-4o · 38.2 · 2024-10-30
GPT-4.5 Gemini 2.0 Flash Inkling-Small GPT-4o
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-03 Inkling-Small 20.6% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2025-04-15 Gemini 2.0 Flash 29.9% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-03-05 GPT-4.5 62.5% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
2024-10-30 GPT-4o 38.2% OpenAI