Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des rubriques pour améliorer à la fois le raisonnement diagnostique et clinique dans les soins de santé.
- Le cadre emploie un RL guidé par des règles et des rubriques sur des questions dérivées de MedBullets pour améliorer la précision du diagnostic.
- Il génère 5,3k scénarios synthétiques multi-tours avec des rubriques multidimensionnelles pour évaluer le dialogue clinique interactif.
- Le modèle obtient une amélioration de plus de 10 % sur MedXpertQA et une précision de 50,1 % sur HealthBench-Hard, surpassant les bases propriétaires comme GPT-5 (thinking).
Cette approche démontre que des ensembles de données synthétiques ciblés et l'entraînement basé sur des rubriques peuvent améliorer systématiquement les performances des LLM médicaux dans des tâches diagnostiques et conversationnelles complexes.