研究者らは、2Dおよびネイティブ3D画像分析を統一し、包括的な医療理解のために設計されたビジョン中心のマルチモーダル大規模言語モデルであるClinFusionを発表した。このシステムは、異種医療画像の課題に対処するために、Cascade Spatial-Aware Locality Fusion演算子を持つ構成型カスケードビジョンエンコーダを利用している。
- ClinFusionは、視覚的質問応答やレポート生成を含む24ベンチマークのうち20で、Hulu-MedやLingshuなどの主要なオープンソースモデルを上回る性能を示した。
- 16ベンチマークのうち13で、GPT-5.2やGemini-3-Flashなどのプロプライエタリモデルよりも優れたマルチモーダル能力を実証した。
- 著者らは、指示追従性の評価のためにMedIF-Benchを提案し、事実性駆動のレポート評価のための領域焦点(RoI)ベースの手法を提案した。
- 認定放射線科医による盲検評価により、ClinFusionが最高ランクのレポートを生み出したことが確認され、新しいRoIベース指標が専門家の判断と相関していることが検証された。
ClinFusionは包括的な医療ベンチマーク全体で新たなSOTAを確立し、検索拡張型臨床ワークフローのためにエージェント型ツール使用と組み合わせて拡張可能である。