Les auteurs présentent Fathom-Vaidya, un modèle de 30B paramètres qui utilise des données synthétiques et l'apprentissage par renforcement basé sur des grilles pour améliorer le raisonnement diagnostique et clinique en santé. Le cadre d'entraînement applique d'abord un RL guidé par des règles aux questions dérivées de MedBullets pour le diagnostic, puis utilise 5,3k scénarios synthétiques multi-tours avec des grilles multidimensionnelles pour les tâches cliniques interactives.
- Atteint une précision de 50,1 % sur HealthBench-Hard, surpassant les bases propriétaires comme GPT-5 (thinking).
- Offre une amélioration de plus de 10 % sur le benchmark MedXpertQA.
- Aborde les faiblesses dans les scénarios diagnostiques complexes et les dialogues contextuels identifiés par des benchmarks récents.
Les résultats démontrent que des ensembles de données synthétiques ciblés et l'entraînement basé sur des grilles peuvent améliorer systématiquement le raisonnement diagnostique et clinique interactif dans les LLMs médicaux.