저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다.

  • 프레임워크는 MedBullets에서 파생된 질문에 대해 규칙 및 기준 유도 RL을 사용하여 진단 정확도를 개선합니다.
  • 상호작용식 임상 대화를 평가하기 위해 다차원 기준이 있는 5.3k 개의 합성 멀티 턴 시나리오를 생성합니다.
  • 이 모델은 MedXpertQA에서 10% 이상의 개선을 달성하고 HealthBench-Hard에서 50.1%의 정확도를 기록하여 GPT-5 (thinking)과 같은 독점 베이스라인을 능가합니다.

이 접근 방식은 표적화된 합성 데이터셋과 기준 기반 훈련이 복잡한 진단 및 대화 작업 전반에 걸쳐 의료 LLM 성능을 체계적으로 향상시킬 수 있음을 보여줍니다.