低所得および中所得環境向けに設計された専用検索拡張生成(RAG)システムであるVITAが、HealthBenchベンチマークにおいて汎用大規模言語モデルと比較評価されました。GPT-4.1ジャッジによって採点された4,023問の質問において、VITAはルーブリックのポイントの51.9%を獲得し1位となり、GPT-5.4、o4-mini、Gemini 3.1 Pro、Claude Sonnet 4.6を上回りました。

より新しいモデルに対して中立なオープンウェイトジャッジを用いて再評価した際、VITAは質問ごとの平均スコアでGPT-5.5と同等を達成し、ポイント加重スコアでは首位となり、最も多くの質問で勝利しました。 この研究は、コーパスの特定性が臨床的文脈におけるグラウンディングを改善し、通信の洗練度が低い可能性があっても、専門システムが最先端LLMと競争力を維持できることを示しています。