专为中低收入环境设计的检索增强生成系统 VITA,在 HealthBench 基准测试中与通用大型语言模型进行了对比评估。研究表明,即使随着更新的前沿模型发布,针对语料库的特定设计仍能保持具有竞争力的性能。
- 在 4,023 道英文 HealthBench 题目中,VITA 以可能评分点的 51.9% 排名第一,领先于 GPT-5.4(46.1%)、o4-mini(44.3%)、Gemini 3.1 Pro(42.6%)和 Claude Sonnet 4.6(37.3%)。
- 在由 GPT-4.1 裁判进行评分时,VITA 在 45.4% 的题目中得分最高。
- 在使用中立开源裁判的鲁棒性测试中,VITA 与 GPT-5.5 持平,并在加权分数上领先。
- 该系统从精心策划的语料库中检索信息,包括疾病特定指南、印度特定的抗菌素耐药性数据以及资源受限环境下的护理协议。
结果表明,专为临床设计的 RAG 系统仍能与前沿 LLM 竞争,这表明尽管通信润色可能较低,但语料库特异性仍能提升 grounding 效果。