Pesquisadores apresentam o ClinFusion, um modelo de linguagem grande multimodal centrado na visão, projetado para compreensão médica holística que unifica a análise de imagens 2D e nativas em 3D. O sistema utiliza um codificador visual em cascata composicional com um operador de Fusão de Localidade Espacialmente Consciente em Cascata para enfrentar os desafios da imagem médica heterogênea.
- ClinFusion supera modelos open-source líderes como Hulu-Med e Lingshu em 20 dos 24 benchmarks, incluindo perguntas e respostas visuais e geração de relatórios.
- Demonstra capacidades multimodais superiores aos modelos proprietários como GPT-5.2 e Gemini-3-Flash em 13 dos 16 benchmarks.
- Os autores propõem o MedIF-Bench para avaliação de seguimento de instruções e um método fundamentado na região de interesse para avaliação de relatórios orientada pela factualidade.
- Uma avaliação cega por radiologistas certificados pelo conselho confirmou que o ClinFusion produziu os relatórios melhor classificados, validando a correlação da nova métrica fundamentada em RoI com o julgamento de especialistas.
ClinFusion estabelece um novo estado da arte em benchmarks médicos abrangentes e pode ser aumentado com uso de ferramentas agênticas para fluxos de trabalho clínicos com recuperação aumentada.