저소득 및 중소득 환경을 위해 설계된 전용 검색 증강 생성(RAG) 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델에 대해 평가되었습니다. GPT-4.1 심판이 채점한 4,023개의 질문에 대해 VITA는 가능한 루브릭 포인트의 51.9%를 획득하여 1위를 차지했으며, GPT-5.4, o4-mini, Gemini 3.1 Pro 및 Claude Sonnet 4.6을 앞질렀습니다.
중립적인 오픈 웨이트 심판을 사용하여 더 새로운 모델에 대해 재평가했을 때, VITA는 질문당 평균 점수에서 GPT-5.5와 동등함을 달성했으며, 포인트 가중 점수에서는 선두를 차지하고 가장 많은 질문에서 승리했습니다. 이 연구는 코퍼스 특이성이 임상 문맥에서의 그라운딩을 개선하여 잠재적으로 낮은 커뮤니케이션 다듬기에도 불구하고 전문 시스템이 최전방 LLM과 경쟁력을 유지할 수 있음을 나타냅니다.