저소득 및 중산층 국가를 위해 설계된 목적 특화 검색 증강 생성 시스템인 VITA가 HealthBench 벤치마크에서 범용 대규모 언어 모델들과 비교 평가되었습니다. 이 연구는 새로운 최첨단 모델이 출시됨에 따라라도 코퍼스 특화 설계가 경쟁력 있는 성능을 유지할 수 있음을 보여줍니다.
- 4,023개의 영어 HealthBench 질문에서 VITA는 가능한 루브릭 점수의 51.9%를 획득하며 GPT-5.4(46.1%), o4-mini(44.3%), Gemini 3.1 Pro(42.6%), Claude Sonnet 4.6(37.3%)를 앞서 1위를 차지했습니다.
- GPT-4.1 판정자가 채점했을 때 VITA는 질문의 45.4%에서 최고 점수를 받았습니다.
- 중립적인 오픈소스 판정자를 사용한 견고성 테스트에서 VITA는 GPT-5.5와 동등한 성능을 보였으며, 가중치 기반 점수에서는 선두를 유지했습니다.
- 이 시스템은 질병별 지침, 인도 특화 항생제 내성 데이터, 자원 제약 환경의 진료 프로토콜을 포함한 선별된 코퍼스에서 정보를 검색합니다.
이 결과는 목적 특화 임상 RAG 시스템이 최첨단 LLM들과 여전히 경쟁력 있음을 시사하며, 잠재적으로 낮은 의사소통 정교함에도 불구하고 코퍼스 특화성이 근거를 강화한다는 것을 나타냅니다.