शोधकर्ताओं ने ClinFusion का परिचय दिया है, जो एक दृष्टि-केंद्रित बहुआयामी बड़े भाषा मॉडल है जिसे क्लिनिकल प्रैक्टिस में AI को तैनात करने की चुनौतियों को 2D और 3D चिकित्सा छवि समझ को एकीकृत करके संबोधित करने के लिए डिज़ाइन किया गया है। इस सिस्टम में एक संयोजक कैस्केडेड वीजन एन्कोडर Cascade Spatial-Aware Locality Fusion ऑपरेटर के साथ शामिल है और इसमें MedIF-Bench और क्षेत्र-की-दृष्टि-ग्राउंडेड मेट्रिक्स से मिलकर बना एक नया मूल्यांकन फ्रेमवर्क शामिल है।
- ClinFusion 24 में से 20 बेंचमार्क पर नई राज्य-की-सर्वोच्चता स्थापित करता है, Hulu-Med और Lingshu जैसे ओपन-सोर्स मॉडल को पछाड़ता है।
- यह 16 में से 13 बेंचमार्क पर GPT-5.2 और Gemini-3-Flash जैसे प्रोप्राइटरी मॉडल की तुलना में श्रेष्ठ बहुआयामी क्षमताओं को प्रदर्शित करता है।
- यह मॉडल रिट्रीवल-एगमेंटेड और टूल-सहायता वाले क्लिनिकल वर्कफ़्लो के लिए एजेंटिक टूल उपयोग का समर्थन करता है।
- बोर्ड-प्रमाणित रेडियोलॉजिस्ट द्वारा अंधा मूल्यांकन पुष्टि करता है कि ClinFusion सबसे उच्च रैंक वाली रिपोर्टें उत्पन्न करता है।
- प्रस्तावित RoI-ग्राउंडेड मेट्रिक स्वचालित मूल्यांकन मेट्रिक्स में विशेषज्ञ निर्णय के साथ सबसे मजबूत सहसंबंध दिखाता है।
लेखक इसे महत्वपूर्ण मानते हैं क्योंकि यह एक क्लिनिकल-अलाइन, तथ्यात्मकता-चालित मूल्यांकन विधि प्रदान करता है और इस बात की पुष्टि करता है कि उनके मॉडल का आउटपुट विशेषज्ञ रेडियोलॉजिस्ट के निर्णय के साथ निकटता से मेल खाता है।