Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.

  • El modelo alcanza una precisión del 50.1% en HealthBench-Hard, superando a las bases propietarias que incluyen GPT-5 (thinking).
  • Demuestra una mejora superior al 10% en el benchmark MedXpertQA.
  • El enfoque mejora sistemáticamente los escenarios diagnósticos complejos y las capacidades de diálogo contextual.

Este trabajo demuestra que los conjuntos de datos sintéticos dirigidos y el entrenamiento basado en rúbricas pueden abordar eficazmente las debilidades persistentes en los LLM médicos.