Un système de génération augmentée par récupération (RAG) conçu spécifiquement, nommé VITA et destiné aux contextes à revenus faibles et moyens, a été évalué contre des modèles de langage larges à usage général sur le benchmark HealthBench. Sur 4 023 questions jugées par un juge GPT-4.1, VITA s'est classé premier avec 51,9 % des points possibles de la grille d'évaluation, surpassant GPT-5.4, o4-mini, Gemini 3.1 Pro et Claude Sonnet 4.6.
Lors d'une réévaluation contre des modèles plus récents à l'aide d'un juge neutre à poids ouvert, VITA a atteint la parité avec GPT-5.5 sur le score moyen par question, tout en menant sur le score pondéré par points et en remportant le plus grand nombre de questions. L'étude indique que la spécificité du corpus améliore l'ancrage dans les contextes cliniques, permettant aux systèmes spécialisés de rester compétitifs face aux LLM de pointe malgré un potentiel manque de finesse dans la communication.