研究人员推出了 ClinFusion,这是一种以视觉为核心的多模态大语言模型,旨在通过统一 2D 和 3D 医学图像理解来解决将 AI 部署到临床实践中的挑战。该系统采用组合式级联视觉编码器,包含 Cascade Spatial-Aware Locality Fusion 算子,并引入了一个由 MedIF-Bench 和基于感兴趣区域(region-of-interest)的指标组成的新评估框架。

  • ClinFusion 在 24 个基准测试中的 20 个上创下新的最先进水平,优于 Hulu-Med 和 Lingshu 等开源模型。
  • 在 16 个基准测试中的 13 个上,其多模态能力优于 GPT-5.2 和 Gemini-3-Flash 等专有模型。
  • 该模型支持代理工具使用,用于检索增强和工具辅助的临床工作流。
  • 由持证放射科医生进行的盲评确认 ClinFusion 生成了排名最高的报告。
  • 提出的 RoI-grounded 指标在自动评估指标中与专家判断的相关性最强。

作者认为这具有重要意义,因为它提供了一种与临床对齐、以事实性为导向的评估方法,并验证了模型输出与专家放射科医生的判断高度一致。