연구자들은 신경기호 정렬(Neurosymbolic Alignment)을 제안했습니다. 이는 7B 규모의 임상 LLM과 HGNN 기반 생리학적 세계 모델을 결합하여 생성형 임상 추론의 안전성을 개선하는 학습 시 프레임워크입니다. 이 방법은 847K 노드의 생물의학 지식 그래프에서 구조화된 생리학적 지식을 사용하여 후보 응답에 점수를 매기고 반복적인 온-폴리시 ORPO 업데이트를 유도합니다.

  • 표준 ORPO 대비 21.3%p 향상된 90.8%로 임상 안전성 벤치마크(CSS)를 69.5%에서 개선했습니다.
  • 블라인드 하위 집합에서 의사가 평가한 유해 권장 사항 비율(HR)을 14.1%에서 5.1%로 줄였습니다.
  • 약물 상호작용 감지(DID) 점수를 72.8%에서 91.6%로 증가시켰습니다.
  • 매개변수가 10배 적음에도 불구하고 모든 안전성 지표에서 GPT-4 (5-shot)를 초과했습니다.
  • CSS에서 추론 시 자기 수정 파이프라인(SFT+SelfCorrect)보다 11.4%p 더 우수한 성능을 보였습니다.

저자들은 학습 시 생리학적 기반이 오픈 가중치 임상 LLM에서 측정 가능하고 독립적으로 검증 가능한 안전성 개선을 산출한다고 결론지었으나, 배포 환경으로의 전이 가능성을 확인하려면 실제 임상 데이터에 대한 외부 검증이 필요하다고 밝혔습니다.