研究人员推出了ClinFusion,这是一种以视觉为中心的多模态大语言模型,旨在实现全面的医学理解,统一了2D和本地3D图像分析。该系统利用组合式级联视觉编码器,结合Cascade Spatial-Aware Locality Fusion算子,以应对异质医学成像带来的挑战。
- ClinFusion在24项基准测试中的20项上优于Hulu-Med和Lingshu等领先的开源模型,包括视觉问答和报告生成。
- 它在16项基准测试中的13项上展现出超越GPT-5.2和Gemini-3-Flash等专有模型的多模态能力。
- 作者提出了MedIF-Bench用于指令遵循评估,以及一种基于感兴趣区域的事实驱动型报告评估方法。
- 由持证放射科医生进行的盲评确认ClinFusion生成了排名最高的报告,验证了新的RoI基准指标与专家判断的相关性。
ClinFusion在综合医学基准测试中确立了新的最先进水平,并可通过代理工具使用进行增强,以支持检索增强的临床工作流。