Um sistema de geração aumentada por recuperação projetado especificamente chamado VITA, destinado a contextos de baixa e média renda, foi avaliado em comparação com modelos de linguagem grandes de propósito geral no benchmark HealthBench. O estudo demonstra que o design específico do corpus pode manter um desempenho competitivo mesmo à medida que novos modelos de ponta são lançados.
- Em 4.023 perguntas do HealthBench em inglês, o VITA ficou em primeiro lugar com 51,9% dos pontos possíveis da rubrica, à frente do GPT-5.4 (46,1%), o4-mini (44,3%), Gemini 3.1 Pro (42,6%) e Claude Sonnet 4.6 (37,3%).
- O VITA obteve a maior pontuação em 45,4% das perguntas quando avaliado por um juiz GPT-4.1.
- Em um teste de robustez usando um juiz aberto e neutro de pesos, o VITA alcançou paridade com o GPT-5.5 e liderou nas pontuações ponderadas por pontos.
- O sistema recupera informações de um corpus curado que inclui diretrizes específicas de doenças, dados sobre resistência antimicrobiana específicos da Índia e protocolos de atendimento em ambientes com recursos limitados.
Os resultados indicam que um sistema clínico RAG projetado especificamente continua competitivo em relação aos LLMs de ponta, sugerindo que a especificidade do corpus melhora o fundamento (grounding) apesar de possivelmente menor refinamento na comunicação.