저소득 및 중산층 국가를 위해 설계된 검색 증강 생성 시스템인 VITA는 HealthBench의 영어 하위 집합에서 1위를 차지하며 GPT-5.4, o4-mini, Gemini 3.1 Pro, Claude Sonnet 4.6을 앞질렀습니다.
- VITA는 4,023개 질문에 대해 가능한 루브릭 점수의 51.9%를 획득했으며, 이는 GPT-5.4(46.1%)와 Claude Sonnet 4.6(37.3%)보다 앞선 결과입니다.
- 중립적인 판정자를 사용하여 GPT-5.5와 같은 최신 모델에 대해 재평가했을 때, VITA는 질문당 평균 점수에서 GPT-5.5와 동률을 이루면서 포인트 가중 점수에서는 선두를 유지했습니다.
- 이 시스템은 질병 특화 가이드라인과 인도 특화 항생제 내성 데이터로 구성된 선별된 코퍼스에서 검색을 수행합니다.
이 결과는 목적에 맞게 구축된 임상용 RAG 시스템이 최첨단 LLM과 여전히 경쟁력이 있음을 보여주며, 낮은 통신 다듬임에도 불구하고 코퍼스 특화성이 기반 grounding을 향상시킨다는 점을 입증합니다.