저자들은 진단 및 임상 의료 추론을 향상시키기 위해 합성 데이터와 기준 기반 강화 학습을 사용하는 30B 파라미터 모델인 Fathom-Vaidya를 소개합니다. 훈련 프레임워크는 먼저 MedBullets에서 파생된 질문들에 규칙 유도 RL을 적용한 후, 상호작용 임상 작업을 위해 다차원 기준과 함께 5.3k 합성 멀티 턴 시나리오를 활용합니다.
- HealthBench-Hard에서 50.1%의 정확도를 달성하여 GPT-5 (thinking) 과 같은 독점 기반을 능가합니다.
- MedXpertQA 벤치마크에서 10% 이상의 개선을 제공합니다.
- 최근 벤치마크에서 식별된 복잡한 진단 시나리오와 문맥적 대화의 약점을 해결합니다.
결과들은 표적화된 합성 데이터셋과 기준 기반 훈련이 의료 LLM에서 진단 및 상호작용 임상 추론을 체계적으로 개선할 수 있음을 보여줍니다.