著者は、診断および臨床ヘルスケアの推論を強化するために合成データとルーブリックベースの強化学習を使用する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまず、診断のためにMedBullets由来の質問にルール誘導型RLを適用し、その後、対話型臨床タスクのために多次元ルーブリックを持つ5.3kの合成マルチターンシナリオを利用します。

  • HealthBench-Hardで50.1%の精度を達成し、GPT-5 (thinking) などのプロプライエタリなベースラインを上回ります。
  • MedXpertQAベンチマークで10%以上の改善を提供します。
  • 最近のベンチマークによって特定された複雑な診断シナリオと文脈的対話の弱点に対処します。

結果は、ターゲットを絞った合成データセットとルーブリックベースのトレーニングが、医療LLMにおける診断および対話型臨床推論を体系的に改善できることを示しています。