Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения диагностического и клинического рассуждения в здравоохранении. Процесс обучения сначала применяет RL, управляемый правилами, к вопросам из MedBullets для диагностики, а затем использует 5.3k синтетических многошаговых сценариев с многомерными рубриками для интерактивных клинических задач.

  • Достигает точности 50.1% на HealthBench-Hard, превосходя проприетарные базовые модели, такие как GPT-5 (thinking).
  • Обеспечивает улучшение более чем на 10% на бенчмарке MedXpertQA.
  • Устраняет слабости в сложных диагностических сценариях и контекстуальном диалоге, выявленные недавними бенчмарками.

Результаты демонстрируют, что целевые синтетические наборы данных и обучение на основе рубрик могут систематически улучшать как диагностическое, так и интерактивное клиническое рассуждение в медицинских LLM.