Un sistema de generación aumentada por recuperación diseñado específicamente llamado VITA, pensado para entornos de ingresos bajos y medios, fue evaluado frente a modelos de lenguaje grandes de propósito general en el benchmark HealthBench. El estudio demuestra que el diseño específico del corpus puede mantener un rendimiento competitivo incluso a medida que se lanzan nuevos modelos de vanguardia.

  • En 4.023 preguntas de HealthBench en inglés, VITA ocupó el primer lugar con 51,9% de los puntos posibles de la rúbrica, por delante de GPT-5.4 (46,1%), o4-mini (44,3%), Gemini 3.1 Pro (42,6%) y Claude Sonnet 4.6 (37,3%).
  • VITA obtuvo la puntuación más alta en el 45,4% de las preguntas cuando fue evaluado por un juez GPT-4.1.
  • En una prueba de robustez utilizando un juez abierto y neutro con pesos abiertos, VITA alcanzó paridad con GPT-5.5 y lideró en puntuaciones ponderadas por puntos.
  • El sistema recupera información de un corpus curado que incluye guías específicas para enfermedades, datos sobre resistencia antimicrobiana específicos de India y protocolos de atención con recursos limitados.

Los resultados indican que un sistema clínico RAG diseñado específicamente sigue siendo competitivo frente a los LLM de vanguardia, lo que sugiere que la especificidad del corpus mejora el anclaje a pesar de una posible menor pulida en la comunicación.