يقدم المؤلفون Fathom-Vaidya، وهو نموذج يحتوي على 30 مليار معلمة يستخدم بيانات اصطناعية وتعلّم التعزيز القائم على معايير التقييم لتعزيز كل من الاستدلال التشخيصي والسريري في الرعاية الصحية.
- يعتمد الإطار على تعزيز التعلم (RL) الموجه بالقواعد والمعايير على الأسئلة المستمدة من MedBullets لتحسين الدقة التشخيصية.
- يولّد 5.3 ألف سيناريو اصطناعي متعدد الأدوار بمعايير تقييم متعددة الأبعاد لتقييم الحوار السريري التفاعلي.
- يحقق النموذج تحسناً يزيد عن 10% على MedXpertAccuracy ودقة بنسبة 50.1% على HealthBench-Hard، متفوقاً على النماذج الأساسية المملوكة مثل GPT-5 (thinking).
يُظهر هذا النهج أن مجموعات البيانات الاصطناعية المستهدفة والتدريب القائم على معايير التقييم يمكن أن يحسّنا بشكل منهجي أداء نماذج اللغات الكبيرة الطبية في المهام التشخيصية والحوارية المعقدة.