著者は、合成データとルーブリックベースの強化学習を使用して、診断および臨床医療の推論の両方を強化する30BパラメータのモデルであるFathom-Vaidyaを紹介します。トレーニングフレームワークはまずMedBullets由来の質問を使用して診断精度を対象とし、その後多次元ルーブリックを持つ5.3kの生成シナリオを通じてマルチターン臨床対話を扱います。

  • モデルはHealthBench-Hardで50.1%の精度を達成し、GPT-5 (thinking)を含むプロプライエタリなベースラインを上回ります。
  • MedXpertQAベンチマークで10%以上の改善を示します。
  • このアプローチは複雑な診断シナリオと文脈対話能力を体系的に改善します。

この研究は、ターゲットを絞った合成データセットとルーブリックベースのトレーニングが医療LLMの持続的な弱点を効果的に解決できることを示しています。