Un sistema de generación aumentada por recuperación (RAG) diseñado específicamente llamado VITA, pensado para entornos de ingresos bajos y medios, fue evaluado frente a modelos de lenguaje grandes de propósito general en el benchmark HealthBench. En 4.023 preguntas calificadas por un juez GPT-4.1, VITA se ubicó en primer lugar con el 51,9% de los puntos posibles de la rúbrica, superando a GPT-5.4, o4-mini, Gemini 3.1 Pro y Claude Sonnet 4.6.

Al ser reevaluado frente a modelos más recientes utilizando un juez de peso abierto neutral, VITA alcanzó la paridad con GPT-5.5 en el puntaje medio por pregunta, mientras lideraba en el puntaje ponderado por puntos y ganaba la mayor cantidad de preguntas. El estudio indica que la especificidad del corpus mejora la fundamentación en contextos clínicos, permitiendo que los sistemas especializados sigan siendo competitivos frente a los LLM de vanguardia a pesar de un posible menor pulido comunicativo.