Multimodal
arxiv arXiv cs.AI · 12 天前 · 1 次浏览

ClinFusion 推出以视觉为核心的多模态大语言模型,实现全面医学理解

研究人员推出了 ClinFusion,这是一种以视觉为核心的多模态大语言模型,旨在通过统一 2D 和 3D 医学图像理解来解决将 AI 部署到临床实践中的挑战。该系统采用组合式级联视觉编码器,包含 Cascade Spatial-Aware Locality Fusion 算子,并引入了一个由 MedIF-Bench 和基于感兴趣区域(region-of-interest)的指标组成的新评估框架。