Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer à la fois le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement cible d'abord la précision diagnostique en utilisant des questions dérivées de MedBullets, puis aborde les interactions cliniques multi-tours via 5,3k scénarios générés avec des grilles multidimensionnelles.
- Le modèle atteint une précision de 50,1 % sur HealthBench-Hard, surpassant les bases propriétaires incluant GPT-5 (thinking).
- Il démontre une amélioration supérieure à 10 % sur le benchmark MedXpertQA.
- L'approche améliore systématiquement les scénarios diagnostiques complexes et les capacités de dialogue contextuel.
Ce travail démontre que des ensembles de données synthétiques ciblés et l'entraînement basé sur des grilles peuvent efficacement traiter les faiblesses persistantes des LLM médicaux.