벤치마크 · general

SimpleQA

4 결과 4 모델

OpenAI's short-form factuality benchmark; accuracy in %.

0 16.5 33 49.5 66 2024-10-30 2025-09-16 2026-08-03 GPT-4.5 · 62.5 · 2025-03-05 Gemini 2.0 Flash · 29.9 · 2025-04-15 Inkling-Small · 20.6 · 2026-08-03 GPT-4o · 38.2 · 2024-10-30
GPT-4.5 Gemini 2.0 Flash Inkling-Small GPT-4o
타임라인
날짜 모델 점수 출처
2026-08-03 Inkling-Small 20.6% Thinking Machines Lab이 276B 오픈 가중치 멀티모달 MoE 모델인 Inkling-Small을 출시
2025-04-15 Gemini 2.0 Flash 29.9% 구글, Gemini 1.5 Pro보다 두 배 빠른 속도와 향상된 품질의 Gemini 2.0 Flash 출시
2025-03-05 GPT-4.5 62.5% 오픈에이아이, 차트GPT 플러스용 최대 규모 모델 GPT-4.5 출시
2024-10-30 GPT-4o 38.2% OpenAI