低所得・中所得環境向けに設計された、VITAという目的特化型の検索拡張生成システムが、HealthBenchベンチマークを用いて汎用大規模言語モデルと比較評価された。本研究は、コーパス固有の設計により、新しい最先端モデルがリリースされても競争力のある性能を維持できることを示している。

  • 4,023件の英語版HealthBench質問において、VITAは可能なルーブリックポイントの51.9%を獲得し、GPT-5.4(46.1%)、o4-mini(44.3%)、Gemini 3.1 Pro(42.6%)、Claude Sonnet 4.6(37.3%)を上回り、首位となった。
  • GPT-4.1による採点では、VITAは質問の45.4%で最高得点を記録した。
  • 中立なオープンウェイトの判定者を用いた堅牢性テストにおいて、VITAはGPT-5.5と同等の性能を示し、ポイント加重スコアでは首位となった。
  • このシステムは、疾患固有のガイドライン、インド固有の抗菌薬耐性データ、資源制約のあるケアプロトコルを含むキュレーション済みコーパスから情報を取得する。

これらの結果は、目的特化型の臨床用RAGシステムが最先端LLMと競争力を持つことを示しており、コーパスの特定性が通信の洗練度が低くてもグラウンディングを向上させる可能性を示唆している。