Para peneliti memperkenalkan ClinFusion, model bahasa besar multimodal berpusat visi yang dirancang untuk pemahaman medis holistik yang menyatukan analisis gambar 2D dan 3D asli. Sistem ini memanfaatkan pengode visi kaskade komposisional dengan operator Fusi Lokalitas Berkesadaran Ruang Kaskade untuk mengatasi tantangan pencitraan medis heterogen.
- ClinFusion mengungguli model sumber terbuka terkemuka seperti Hulu-Med dan Lingshu pada 20 dari 24 benchmark, termasuk tanya jawab visual dan pembuatan laporan.
- Model ini menunjukkan kemampuan multimodal yang unggul dibandingkan model tertutup seperti GPT-5.2 dan Gemini-3-Flash pada 13 dari 16 benchmark.
- Para penulis mengusulkan MedIF-Bench untuk penilaian kepatuhan instruksi dan metode berbasis wilayah ketertarikan (region-of-interest) untuk evaluasi laporan yang didorong oleh faktualitas.
- Evaluasi buta oleh radiolog bersertifikat dewan mengonfirmasi bahwa ClinFusion menghasilkan laporan dengan peringkat tertinggi, memvalidasi korelasi metrik baru berbasis RoI dengan penilaian ahli.
ClinFusion menetapkan rekor baru di seluruh benchmark medis komprehensif dan dapat diperkaya dengan penggunaan alat agentic untuk alur kerja klinis yang diperkuat pengambilan informasi.