Para penulis memperkenalkan Fathom-Vaidya, model 30B parameter yang menggunakan data sintetis dan pembelajaran penguatan berbasis rubrik untuk meningkatkan penalaran diagnostik dan klinis dalam perawatan kesehatan. Kerangka pelatihan pertama-tama menerapkan RL yang dipandu aturan pada pertanyaan yang berasal dari MedBullets untuk diagnosis, kemudian memanfaatkan 5.3k skenario multi-giliran sintetis dengan rubrik multidimensi untuk tugas klinis interaktif.

  • Mencapai akurasi 50,1% di HealthBench-Hard, melampaui baseline proprietaris seperti GPT-5 (thinking).
  • Memberikan peningkatan lebih dari 10% pada benchmark MedXpertQA.
  • Menangani kelemahan dalam skenario diagnostik kompleks dan dialog kontekstual yang diidentifikasi oleh benchmark terbaru.

Hasilnya menunjukkan bahwa dataset sintetis yang ditargetkan dan pelatihan berbasis rubrik dapat secara sistematis meningkatkan penalaran diagnostik dan klinis interaktif dalam LLM medis.