저자들은 합성 데이터와 기준 기반 강화 학습을 사용하여 진단 및 임상 의료 추론을 모두 향상시키는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문을 사용하여 진단 정확도를 목표로 하고, 다차원 기준이 있는 5.3k개의 생성 시나리오를 통해 다중 턴 임상 상호작용을 다룹니다.

  • 모델은 HealthBench-Hard에서 50.1%의 정확도를 달성하여 GPT-5 (thinking)을 포함한 독점 기반 모델을 능가합니다.
  • MedXpertQA 벤치마크에서 10% 이상의 개선을 보여줍니다.
  • 이 접근 방식은 복잡한 진단 시나리오와 문맥 대화 능력을 체계적으로 개선합니다.

이 작업은 표적화된 합성 데이터셋과 기준 기반 훈련이 의료 LLM의 지속적인 약점을 효과적으로 해결할 수 있음을 보여줍니다.