Sebuah sistem generasi yang diperkaya dengan pengambilan kembali (RAG) yang dirancang khusus bernama VITA, yang ditujukan untuk pengaturan pendapatan rendah dan menengah, dievaluasi terhadap model bahasa besar tujuan umum pada benchmark HealthBench. Pada 4.023 pertanyaan yang dinilai oleh hakim GPT-4.1, VITA berada di peringkat pertama dengan 51,9% dari poin rubrik yang mungkin, melampaui GPT-5.4, o4-mini, Gemini 3.1 Pro, dan Claude Sonnet 4.6.

Saat dievaluasi ulang terhadap model yang lebih baru menggunakan hakim bobot terbuka netral, VITA mencapai kesetaraan dengan GPT-5.5 pada skor rata-rata per pertanyaan, sementara memimpin pada skor berbobot poin dan memenangkan paling banyak pertanyaan. Studi tersebut menunjukkan bahwa spesifisitas korpus meningkatkan grounding dalam konteks klinis, memungkinkan sistem khusus tetap kompetitif dengan LLM terdepan meskipun memiliki polishing komunikasi yang mungkin lebih rendah.