研究人员提出神经符号对齐(Neurosymbolic Alignment),这是一种训练时框架,将7B参数规模的临床LLM与基于HGNN的生理世界模型耦合,以改善生成式临床推理的安全性。该方法利用来自包含847K个节点的生物医学知识图谱的结构化生理知识来评估候选响应,并驱动迭代式的在线策略ORPO更新。

  • 在临床安全基准(CSS)上从69.5%提升至90.8%,相比标准ORPO提升了21.3个百分点。
  • 在盲测子集上,将医生评估的有害推荐率(HR)从14.1%降低至5.1%。
  • 药物相互作用检测(DID)得分从72.8%提升至91.6%。
  • 尽管参数量仅为GPT-4的十分之一,但在所有安全指标上均超越GPT-4(5-shot)。
  • 在CSS指标上比推理时自我校正流水线(SFT+SelfCorrect)高出11.4个百分点。

作者得出结论:训练时的生理基础化能产生可测量且独立可验证的安全性提升,适用于开源权重的临床LLM,但需要在真实临床数据上进行外部验证,以确认其在部署场景中的可迁移性。