يقدم الباحثون ClinFusion، وهو نموذج لغوي متعدد الوسائط كبير يركز على الرؤية، مصمم لمعالجة تحديات نشر الذكاء الاصطناعي في الممارسة السريرية من خلال توحيد فهم الصور الطبية ثنائية وثلاثية الأبعاد. يتميز النظام بمُشفِّر رؤية متدرج مركب يتضمن عامل دمج محلي مكاني متسلسل واعٍ، ويتضمن إطار تقييم جديدًا يتكون من MedIF-Bench ومقاييس مبنية على منطقة الاهتمام.

  • يحقق ClinFusion حالة فائقة جديدة في 20 من أصل 24 معيار تقييم، متفوقًا على النماذج مفتوحة المصدر مثل Hulu-Med وLingshu.
  • يُظهر قدرات متعددة الوسائط تتفوق على النماغل المملوكة مثل GPT-5.2 وGemini-3-Flash في 13 من أصل 16 معيار تقييم.
  • يدعم النموذج استخدام الأدوات الوكيلية لعمليات سير العمل السريرية المعززة بالاسترجاع والمساعدة بالأدوات.
  • تؤكد التقييمات العمياء التي أجراها أشعةيون حاصلون على شهادة البورد أن ClinFusion ينتج التقارير الأعلى ترتيبًا.
  • يُظهر مقياس RoI-grounded المقترح أقوى ارتباط مع حكم الخبراء بين مقاييس التقييم التلقائي.

يرى المؤلفون أن هذا الأمر مهم لأنه يوفر طريقة تقييم متوافقة سريريًا وموجهة نحو الموثوقية، ويؤكد أن مخرجات نموذجهم تتطابق بشكل وثيق مع حكم أخصائي الأشعة.