一个专为低收入和中收入环境设计的名为VITA的专用检索增强生成(RAG)系统,在HealthBench基准测试中与通用大型语言模型进行了评估。在由GPT-4.1裁判评分的4,023个问题中,VITA以51.9%的准则得分排名第一,超越了GPT-5.4、o4-mini、Gemini 3.1 Pro和Claude Sonnet 4.6。
当使用中性开放权重裁判针对更新模型重新评估时,VITA在平均每题得分方面与GPT-5.5持平,同时在加权得分上领先,并赢得了最多的问题。 研究表明,语料库的特定性改善了临床背景下的 grounding(依据),使专业系统尽管可能在沟通润色方面略逊一筹,但仍能与前沿LLM保持竞争力。