Os autores apresentam o Fathom-Vaidya, um modelo de 30B parâmetros que utiliza dados sintéticos e aprendizado por reforço baseado em rubricas para aprimorar tanto o raciocínio diagnóstico quanto o clínico na saúde.
- O framework emprega RL guiado por regras e rubricas em perguntas derivadas do MedBullets para melhorar a precisão diagnóstica.
- Ele gera 5.3k cenários sintéticos multironda com rubricas multidimensionais para avaliar o diálogo clínico interativo.
- O modelo alcança uma melhoria de mais de 10% no MedXpertQA e 50,1% de precisão no HealthBench-Hard, superando baselines proprietárias como GPT-5 (thinking).
Esta abordagem demonstra que conjuntos de dados sintéticos direcionados e treinamento baseado em rubricas podem melhorar sistematicamente o desempenho de LLMs médicos em tarefas diagnósticas e conversacionais complexas.