Sebuah sistem retrieval-augmented generation yang dirancang khusus bernama VITA, yang ditujukan untuk negara berpenghasilan rendah dan menengah, dievaluasi terhadap model bahasa besar umum pada benchmark HealthBench. Studi ini menunjukkan bahwa desain yang spesifik terhadap korpus dapat mempertahankan kinerja kompetitif meskipun model terdepan baru terus dirilis.

  • Pada 4.023 pertanyaan HealthBench berbahasa Inggris, VITA berada di peringkat pertama dengan 51,9% dari total poin rubrik yang tersedia, mengungguli GPT-5.4 (46,1%), o4-mini (44,3%), Gemini 3.1 Pro (42,6%), dan Claude Sonnet 4.6 (37,3%).
  • VITA mencetak skor tertinggi pada 45,4% pertanyaan saat dinilai oleh penilai GPT-4.1.
  • Dalam uji ketahanan menggunakan penilai open-weight netral, VITA mencapai kesetaraan dengan GPT-5.5 dan memimpin dalam skor berbobot poin.
  • Sistem ini mengambil informasi dari korpus terkurasi yang mencakup pedoman spesifik penyakit, data resistensi antimikroba khusus India, dan protokol perawatan terbatas sumber daya.

Hasil tersebut menunjukkan bahwa sistem RAG klinis yang dirancang khusus tetap kompetitif dengan LLM terdepan, yang mengindikasikan bahwa spesifisitas korpus meningkatkan grounding meskipun kemungkinan memiliki kelancaran komunikasi yang lebih rendah.