Un système de génération augmentée par récupération conçu spécifiquement, nommé VITA, destiné aux contextes à revenu faible et intermédiaire, a été évalué face à des grands modèles de langage à usage général sur le benchmark HealthBench. L'étude démontre qu'une conception spécifique au corpus peut maintenir des performances compétitives même lorsque de nouveaux modèles de pointe sont publiés.

  • Sur 4 023 questions en anglais du HealthBench, VITA s'est classé premier avec 51,9 % des points possibles selon la grille d'évaluation, devançant GPT-5.4 (46,1 %), o4-mini (44,3 %), Gemini 3.1 Pro (42,6 %) et Claude Sonnet 4.6 (37,3 %).
  • VITA a obtenu le meilleur score sur 45,4 % des questions lorsqu'il a été évalué par un juge GPT-4.1.
  • Lors d'un test de robustesse utilisant un juge ouvert et neutre en termes de poids, VITA a atteint l'égalité avec GPT-5.5 et a mené sur les scores pondérés par points.
  • Le système effectue des recherches dans un corpus curaté incluant des lignes directrices spécifiques à certaines maladies, des données sur la résistance aux antimicrobiens propres à l'Inde et des protocoles de soins adaptés aux contextes à ressources limitées.

Les résultats indiquent qu'un système RAG clinique conçu spécifiquement reste compétitif face aux grands modèles de langage de pointe, suggérant que la spécificité du corpus améliore l'ancrage malgré une finition linguistique potentiellement inférieure.