研究者らは、2Dおよび3Dの医療画像理解を統合することで、臨床現場でのAI導入の課題に対処するために設計されたビジョン中心のマルチモーダル大規模言語モデルであるClinFusionを紹介した。本システムは、Cascade Spatial-Aware Locality Fusion演算子を持つ構成型カスケードビジョンエンコーダを特徴とし、MedIF-Benchおよび領域焦点(ROI)ベースの指標からなる新しい評価フレームワークを含んでいる。
- ClinFusionは24ベンチマークのうち20で新たな最先端記録を更新し、Hulu-MedやLingshuのようなオープンソースモデルを上回る。
- 16ベンチマークのうち13で、GPT-5.2やGemini-3-Flashといったプロプライエタリモデルよりも優れたマルチモーダル能力を示す。
- 本モデルは、検索拡張およびツール支援の臨床ワークフローのためのエージェント型ツール使用をサポートする。
- 認定放射線科医による盲検評価により、ClinFusionが最高ランクのレポートを生成することが確認された。
- 提案されたRoIベースの指標は、自動評価指標の中で専門家の判断との相関が最も強いことを示す。
著者らはこれが重要であると考えている。なぜなら、これは臨床的に整合性のある事実駆動の評価方法を提供し、モデルの出力が専門家の放射線科医の判断と密接に一致していることを検証するからである。