ベンチマーク · general

HealthBench

16 結果 6 モデル

OpenAI's physician-graded health-conversation benchmark.

0 14 28 42 56 2025-08-07 2026-02-08 2026-08-13 GPT-5 · 46.2 · 2025-08-07 VITA · 51.9 · 2026-08-13 VITA · 51.9 · 2026-08-13 VITA · 51.9 · 2026-08-13 GPT-5.4 · 46.1 · 2026-08-13 GPT-5.4 · 46.1 · 2026-08-13 GPT-5.4 · 46.1 · 2026-08-13 o4-mini · 44.3 · 2026-08-13 o4-mini · 44.3 · 2026-08-13 o4-mini · 44.3 · 2026-08-13 Gemini 3.1 Pro · 42.6 · 2026-08-13 Gemini 3.1 Pro · 42.6 · 2026-08-13 Gemini 3.1 Pro · 42.6 · 2026-08-13 Claude Sonnet 4.6 · 37.3 · 2026-08-13 Claude Sonnet 4.6 · 37.3 · 2026-08-13 Claude Sonnet 4.6 · 37.3 · 2026-08-13
GPT-5 VITA GPT-5.4 o4-mini Gemini 3.1 Pro Claude Sonnet 4.6
タイムライン
日付 モデル スコア ソース
2026-08-13 VITA 51.9% VITAの臨床用RAGはHealthBenchにおいて最先端LLMと同等かそれ以上の性能を示す
2026-08-13 GPT-5.4 46.1% VITAの臨床用RAGはHealthBenchにおいて最先端LLMと同等かそれ以上の性能を示す
2026-08-13 o4-mini 44.3% VITAの臨床用RAGはHealthBenchにおいて最先端LLMと同等かそれ以上の性能を示す
2026-08-13 Gemini 3.1 Pro 42.6% VITAの臨床用RAGはHealthBenchにおいて最先端LLMと同等かそれ以上の性能を示す
2026-08-13 Claude Sonnet 4.6 37.3% VITAの臨床用RAGはHealthBenchにおいて最先端LLMと同等かそれ以上の性能を示す
2026-08-13 VITA 51.9% Corpus固有のVITA RAGはHealthBenchで最先端LLMに匹敵または上回る
2026-08-13 GPT-5.4 46.1% Corpus固有のVITA RAGはHealthBenchで最先端LLMに匹敵または上回る
2026-08-13 o4-mini 44.3% Corpus固有のVITA RAGはHealthBenchで最先端LLMに匹敵または上回る
2026-08-13 Gemini 3.1 Pro 42.6% Corpus固有のVITA RAGはHealthBenchで最先端LLMに匹敵または上回る
2026-08-13 Claude Sonnet 4.6 37.3% Corpus固有のVITA RAGはHealthBenchで最先端LLMに匹敵または上回る
2026-08-13 VITA 51.9% VITA臨床RAGシステムはHealthBenchで最先端LLMと同等またはそれ以上の性能
2026-08-13 GPT-5.4 46.1% VITA臨床RAGシステムはHealthBenchで最先端LLMと同等またはそれ以上の性能
2026-08-13 o4-mini 44.3% VITA臨床RAGシステムはHealthBenchで最先端LLMと同等またはそれ以上の性能
2026-08-13 Gemini 3.1 Pro 42.6% VITA臨床RAGシステムはHealthBenchで最先端LLMと同等またはそれ以上の性能
2026-08-13 Claude Sonnet 4.6 37.3% VITA臨床RAGシステムはHealthBenchで最先端LLMと同等またはそれ以上の性能
2025-08-07 GPT-5 46.2% OpenAIが適応的推論と統一アーキテクチャを搭載したGPT-5をリリース