研究者らは、7Bパラメータの臨床用LLMとHGNNベースの生理学的ワールドモデルを結合するトレーニング時のフレームワークである「Neurosymbolic Alignment」を提案し、生成型臨床推論における安全性の向上を図った。本手法は、847Kノードの生体医学的知識グラフから得られた構造化された生理学的知識を用いて候補応答をスコアリングし、反復的なオンポリシーORPO更新を駆動する。

  • 臨床安全性ベンチマーク(CSS)を69.5%から90.8%に向上させ、標準的なORPOと比較して21.3パーセントポイントの改善を実現。
  • ブラインド化されたサブセットにおいて、医師による評価で有害な推奨率(HR)を14.1%から5.1%に低減。
  • 薬物相互作用検出(DID)スコアを72.8%から91.6%に向上。
  • パラメータ数が10分の1であるにもかかわらず、すべての安全性指標においてGPT-4 (5-shot) を上回る。
  • 推論時の自己修正パイプライン(SFT+SelfCorrect)と比較して、CSSで11.4パーセントポイント優位。

著者らは、トレーニング時の生理学的根拠がオープンウェイトの臨床用LLMにおいて測定可能かつ独立して検証可能な安全性の改善をもたらすと結論づけている。ただし、デプロイメント環境への転移可能性を確認するためには、実際の臨床データを用いた外部検証が必要である。