تم تقييم نظام توليد معزز بالاسترجاع (RAG) المصمم خصيصًا والمسمى VITA، والمخصص للبيئات منخفضة ومتوسطة الدخل، مقابل نماذج لغوية كبيرة لأغراض عامة على معيار HealthBench. من بين 4023 سؤالًا تم تقييمها بواسطة حكم GPT-4.1، احتل VITA المرتبة الأولى بنسبة 51.9% من نقاط المعايير الممكنة، متفوقًا على GPT-5.4 و o4-mini و Gemini 3.1 Pro و Claude Sonnet 4.6.
عند إعادة التقييم مقابل نماذج أحدث باستخدام حكم مفتوح الأوزان محايد، حقق VITA تعادلًا مع GPT-5.5 في متوسط النقاط لكل سؤال، بينما تصدر في النقاط المرجحة وحصل على أكبر عدد من الأسئلة. تشير الدراسة إلى أن خصوصية المجموعة النصية تحسن التأسيس (grounding) في السياقات السريرية، مما يسمح للأنظمة المتخصصة بالبقاء قادرة على المنافسة مع نماذج LLM المتقدمة على الرغم من احتمالية انخفاض دقة التواصل.