Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.
- Alcanza una precisión del 50.1% en HealthBench-Hard, superando a las bases propietarias como GPT-5 (thinking).
- Ofrece una mejora de más del 10% en el benchmark MedXpertQA.
- Aborda debilidades en escenarios diagnósticos complejos y diálogos contextuales identificados por benchmarks recientes.
Los resultados demuestran que los conjuntos de datos sintéticos dirigidos y el entrenamiento basado en rúbricas pueden mejorar sistemáticamente tanto el razonamiento diagnóstico como el clínico interactivo en LLMs médicos.