Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en el ámbito sanitario.

  • El marco emplea RL guiado por reglas y rúbricas en preguntas derivadas de MedBullets para mejorar la precisión diagnóstica.
  • Genera 5.3k escenarios sintéticos multironda con rúbricas multidimensionales para evaluar el diálogo clínico interactivo.
  • El modelo logra una mejora superior al 10% en MedXpertQA y una precisión del 50.1% en HealthBench-Hard, superando a las bases propietarias como GPT-5 (thinking).

Este enfoque demuestra que los conjuntos de datos sintéticos dirigidos y el entrenamiento basado en rúbricas pueden mejorar sistemáticamente el rendimiento de los LLM médicos en tareas diagnósticas y conversacionales complejas.