微软研究院推出了CARE-X,这是一个研究模型,旨在通过将生成式报告撰写与校准的诊断预测相结合,解决当前放射学视觉-语言模型的不足。该系统使用强化学习(DAPO)来奖励临床正确性,并将Qwen3-VL-4B-Instruct模型与确定性测量工具配对,以评估需要精确计算的条件性能。

  • CARE-X结合了SigLIP2-so400M视觉编码器和Phi-4-mini-instruct (3.8B)语言模型,并增加了用于分类和视觉定位的任务特定辅助头。
  • 该模型采用双重推理,在一次前向传播中生成自由文本响应和带有置信度分数的结构化预测。
  • 训练包括三个阶段:监督微调流水线,随后是基于DAPO的强化学习,以优化临床报告和诊断准确性的奖励。
  • 一项单独的实验将Qwen3-VL-4B-Instruct与确定性测量工具配对,用于计算心脏和胸部宽度,比较直接计算与视觉近似。
  • 该模型在Narayana Health的真实印度临床数据上进行了验证,包括罕见的ICU病理学和CT确认的扩大病症。

CARE-X旨在提供一种统一的方法,支持多样化的放射学工作流程,同时保持临床保真度,满足表达性报告生成和精确、可调整阈值的诊断输出的需求。