Les chercheurs présentent ClinFusion, un grand modèle de langage multimodal centré sur la vision conçu pour relever les défis du déploiement de l'IA dans la pratique clinique en unifiant la compréhension des images médicales 2D et 3D. Le système intègre un encodeur visuel en cascade compositionnel avec un opérateur de fusion de localité spatiale-aware en cascade et comprend un nouveau cadre d'évaluation composé de MedIF-Bench et de métriques ancrées sur la région d'intérêt.
- ClinFusion établit un nouvel état de l'art sur 20 des 24 benchmarks, surpassant les modèles open-source tels que Hulu-Med et Lingshu.
- Il démontre des capacités multimodales supérieures à celles des modèles propriétaires GPT-5.2 et Gemini-3-Flash sur 13 des 16 benchmarks.
- Le modèle prend en charge l'utilisation d'outils agents pour les flux de travail cliniques augmentés par récupération et assistés par outils.
- Des évaluations en aveugle par des radiologues certifiés confirment que ClinFusion produit les rapports les mieux classés.
- La métrique RoI-grounded proposée présente la corrélation la plus forte avec le jugement d'expert parmi les métriques d'évaluation automatiques.
Les auteurs considèrent cela comme significatif car cela fournit une méthode d'évaluation alignée sur le plan clinique et axée sur l'exactitude factuelle, et valide que les sorties de leur modèle correspondent étroitement au jugement des radiologues experts.