Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar o raciocínio diagnóstico e clínico na saúde. A estrutura de treinamento primeiro aplica RL guiado por regras a perguntas derivadas do MedBullets para diagnóstico, depois utiliza 5.3k cenários sintéticos multi-turno com rubricas multidimensionais para tarefas clínicas interativas.
- Alcança 50,1% de precisão no HealthBench-Hard, superando baselines proprietárias como GPT-5 (thinking).
- Oferece melhoria de mais de 10% no benchmark MedXpertQA.
- Aborda fraquezas em cenários diagnósticos complexos e diálogos contextuais identificados por benchmarks recentes.
Os resultados demonstram que conjuntos de dados sintéticos direcionados e treinamento baseado em rubricas podem melhorar sistematicamente tanto o raciocínio diagnóstico quanto o clínico interativo em LLMs médicos.