Benchmark · general

HealthBench

16 条结果 6 个模型

OpenAI's physician-graded health-conversation benchmark.

0 14 28 42 56 2025-08-07 2026-02-08 2026-08-13 GPT-5 · 46.2 · 2025-08-07 VITA · 51.9 · 2026-08-13 VITA · 51.9 · 2026-08-13 VITA · 51.9 · 2026-08-13 GPT-5.4 · 46.1 · 2026-08-13 GPT-5.4 · 46.1 · 2026-08-13 GPT-5.4 · 46.1 · 2026-08-13 o4-mini · 44.3 · 2026-08-13 o4-mini · 44.3 · 2026-08-13 o4-mini · 44.3 · 2026-08-13 Gemini 3.1 Pro · 42.6 · 2026-08-13 Gemini 3.1 Pro · 42.6 · 2026-08-13 Gemini 3.1 Pro · 42.6 · 2026-08-13 Claude Sonnet 4.6 · 37.3 · 2026-08-13 Claude Sonnet 4.6 · 37.3 · 2026-08-13 Claude Sonnet 4.6 · 37.3 · 2026-08-13
GPT-5 VITA GPT-5.4 o4-mini Gemini 3.1 Pro Claude Sonnet 4.6
时间线
日期 模型 得分 来源
2026-08-13 VITA 51.9% VITA 临床 RAG 在 HealthBench 上匹配或超越前沿大语言模型
2026-08-13 GPT-5.4 46.1% VITA 临床 RAG 在 HealthBench 上匹配或超越前沿大语言模型
2026-08-13 o4-mini 44.3% VITA 临床 RAG 在 HealthBench 上匹配或超越前沿大语言模型
2026-08-13 Gemini 3.1 Pro 42.6% VITA 临床 RAG 在 HealthBench 上匹配或超越前沿大语言模型
2026-08-13 Claude Sonnet 4.6 37.3% VITA 临床 RAG 在 HealthBench 上匹配或超越前沿大语言模型
2026-08-13 VITA 51.9% 针对特定语料的VITA RAG在HealthBench上匹配或超越前沿LLM
2026-08-13 GPT-5.4 46.1% 针对特定语料的VITA RAG在HealthBench上匹配或超越前沿LLM
2026-08-13 o4-mini 44.3% 针对特定语料的VITA RAG在HealthBench上匹配或超越前沿LLM
2026-08-13 Gemini 3.1 Pro 42.6% 针对特定语料的VITA RAG在HealthBench上匹配或超越前沿LLM
2026-08-13 Claude Sonnet 4.6 37.3% 针对特定语料的VITA RAG在HealthBench上匹配或超越前沿LLM
2026-08-13 VITA 51.9% VITA临床RAG系统在HealthBench上持平或超越前沿LLM
2026-08-13 GPT-5.4 46.1% VITA临床RAG系统在HealthBench上持平或超越前沿LLM
2026-08-13 o4-mini 44.3% VITA临床RAG系统在HealthBench上持平或超越前沿LLM
2026-08-13 Gemini 3.1 Pro 42.6% VITA临床RAG系统在HealthBench上持平或超越前沿LLM
2026-08-13 Claude Sonnet 4.6 37.3% VITA临床RAG系统在HealthBench上持平或超越前沿LLM
2025-08-07 GPT-5 46.2% OpenAI 发布具备自适应推理与统一架构的 GPT-5