著者らは、合成データとルーブリックベースの強化学習を用いて、診断および臨床医療の推論の両方を強化する 30B パラメータのモデル Fathom-Vaidya を紹介しています。
- フレームワークは、MedBullets から派生した質問に対してルールおよびルーブリック誘導の RL を採用し、診断精度を向上させます。
- インタラクティブな臨床対話を評価するために、多次元ルーブリックを持つ 5.3k の合成マルチターンシナリオを生成します。
- このモデルは MedXpertQA で 10% 以上の改善を実現し、HealthBench-Hard で 50.1% の精度を達成し、GPT-5 (thinking) などのプロプライエタリなベースラインを上回っています。
このアプローチは、ターゲットを絞った合成データセットとルーブリックベースのトレーニングが、複雑な診断および対話タスク全体で医療 LLM のパフォーマンスを体系的に向上できることを示しています。