作者介绍了 Fathom-Vaidya,这是一个拥有 30B 参数的模型,它使用合成数据和基于量表的强化学习来增强诊断和临床医疗保健推理。训练框架首先对来自 MedBullets 的诊断问题应用规则引导的 RL,然后利用具有多维量表的 5.3k 合成多轮场景进行交互式临床任务。
- 在 HealthBench-Hard 上达到 50.1% 的准确率,超越了 GPT-5 (thinking) 等专有基线。
- 在 MedXpertQA 基准测试中实现了超过 10% 的提升。
- 解决了最近基准测试中发现的复杂诊断场景和上下文对话中的弱点。
结果表明,有针对性的合成数据集和基于量表的训练可以系统地改善医疗 LLM 的诊断和交互式临床推理。