Para peneliti memperkenalkan ClinFusion, model bahasa besar multimodal berpusat visi yang dirancang untuk mengatasi tantangan penerapan AI dalam praktik klinis dengan menyatukan pemahaman gambar medis 2D dan 3D. Sistem ini memiliki pengkode visi kaskade komposisional dengan operator Fusi Lokalitas Berpenuh Spasial Kaskade dan mencakup kerangka evaluasi baru yang terdiri dari MedIF-Bench serta metrik berbasis wilayah minat.

  • ClinFusion menetapkan state-of-the-art baru di 20 dari 24 benchmark, mengungguli model sumber terbuka seperti Hulu-Med dan Lingshu.
  • Model ini menunjukkan kemampuan multimodal yang unggul dibandingkan model tertutup GPT-5.2 dan Gemini-3-Flash pada 13 dari 16 benchmark.
  • Model ini mendukung penggunaan alat agentic untuk alur kerja klinis yang diperkaya pengambilan informasi dan dibantu alat.
  • Evaluasi buta oleh radiolog bersertifikat dewan mengonfirmasi bahwa ClinFusion menghasilkan laporan dengan peringkat tertinggi.
  • Metrik berbasis RoI yang diusulkan menunjukkan korelasi terkuat dengan penilaian ahli di antara metrik evaluasi otomatis.

Para penulis menganggap ini signifikan karena menyediakan metode penilaian yang selaras secara klinis dan didorong oleh faktualitas, serta memvalidasi bahwa output model mereka sangat sejalan dengan penilaian radiolog ahli.