Um sistema de geração aumentada por recuperação (RAG) feito sob medida chamado VITA, projetado para ambientes de baixa e média renda, foi avaliado contra modelos de linguagem grandes de propósito geral no benchmark HealthBench. Em 4.023 perguntas avaliadas por um juiz GPT-4.1, o VITA ficou em primeiro lugar com 51,9% dos pontos possíveis da rubrica, superando GPT-5.4, o4-mini, Gemini 3.1 Pro e Claude Sonnet 4.6.
Ao ser reavaliado contra modelos mais recentes usando um juiz de peso aberto neutro, o VITA alcançou paridade com o GPT-5.5 na pontuação média por pergunta, enquanto liderava na pontuação ponderada por pontos e venceu a maior quantidade de perguntas. O estudo indica que a especificidade do corpus melhora o grounding em contextos clínicos, permitindo que sistemas especializados permaneçam competitivos frente aos LLMs de ponta apesar de um possível menor refinamento na comunicação.