लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संश्लेषित डेटा और रूबरिक-आधारित पुनर्बल सीखने (reinforcement learning) का उपयोग करके नैदानिक और चिकित्सा स्वास्थ्य तर्क को बढ़ाने के लिए। प्रशिक्षण ढांचा पहले MedBullets से व्युत्पन्न प्रश्नों का उपयोग करके नैदानिक सटीकता पर केंद्रित होता है और फिर बहु-आयामी रूबरिक के साथ 5.3k उत्पन्न परिदृश्यों के माध्यम से बहु-चरण चिकित्सा बातचीत को संबोधित करता है।

  • मॉडल HealthBench-Hard पर 50.1% सटीकता प्राप्त करता है, जिसमें GPT-5 (thinking) सहित स्वामित्व वाली आधार रेखाओं को पार कर जाता है।
  • यह MedXpertQA बेंचमार्क पर 10% से अधिक सुधार दिखाता है।
  • दृष्टिकोण जटिल नैदानिक परिदृश्यों और संदर्भित संवाद क्षमताओं को व्यवस्थित रूप से बेहतर बनाता है।

यह कार्य दर्शाता है कि लक्षित संश्लेषित डेटासेट और रूबरिक-आधारित प्रशिक्षण चिकित्सा LLMs में स्थिर कमजोरियों को प्रभावी ढंग से संबोधित कर सकते हैं।