研究者らは、2Dおよびネイティブ3D画像分析を統一し、包括的な医療理解のために設計されたビジョン中心のマルチモーダル大規模言語モデルであるClinFusionを発表した。このシステムは、異種医療画像の課題に対処するために、Cascade Spatial-Aware Locality Fusion演算子を持つ構成型カスケードビジョンエンコーダを利用している。

  • ClinFusionは、視覚的質問応答やレポート生成を含む24ベンチマークのうち20で、Hulu-MedやLingshuなどの主要なオープンソースモデルを上回る性能を示した。
  • 16ベンチマークのうち13で、GPT-5.2やGemini-3-Flashなどのプロプライエタリモデルよりも優れたマルチモーダル能力を実証した。
  • 著者らは、指示追従性の評価のためにMedIF-Benchを提案し、事実性駆動のレポート評価のための領域焦点(RoI)ベースの手法を提案した。
  • 認定放射線科医による盲検評価により、ClinFusionが最高ランクのレポートを生み出したことが確認され、新しいRoIベース指標が専門家の判断と相関していることが検証された。

ClinFusionは包括的な医療ベンチマーク全体で新たなSOTAを確立し、検索拡張型臨床ワークフローのためにエージェント型ツール使用と組み合わせて拡張可能である。