Les chercheurs présentent ClinFusion, un modèle de langage multimodal large centré sur la vision, conçu pour une compréhension médicale holistique qui unifie l'analyse d'images 2D et native 3D. Le système utilise un encodeur visuel en cascade compositionnel avec un opérateur de fusion de localité spatialement conscient en cascade (Cascade Spatial-Aware Locality Fusion) pour relever les défis de l'imagerie médicale hétérogène.

  • ClinFusion surpasse les modèles open-source de pointe tels que Hulu-Med et Lingshu sur 20 benchmarks sur 24, y compris la réponse aux questions visuelles et la génération de rapports.
  • Il démontre des capacités multimodales supérieures à celles des modèles propriétaires tels que GPT-5.2 et Gemini-3-Flash sur 13 benchmarks sur 16.
  • Les auteurs proposent MedIF-Bench pour l'évaluation du suivi d'instructions et une méthode ancrée sur la région d'intérêt pour l'évaluation de la factualité des rapports.
  • Une évaluation en aveugle par des radiologues certifiés a confirmé que ClinFusion a produit les rapports les mieux classés, validant la corrélation de la nouvelle métrique ancrée sur la RoI avec le jugement d'expert.

ClinFusion établit un nouvel état de l'art sur des benchmarks médicaux complets et peut être enrichi par l'utilisation d'outils agents pour des flux de travail cliniques à récupération augmentée.