Pesquisadores apresentam o ClinFusion, um modelo de linguagem multimodal grande centrado na visão, projetado para abordar os desafios da implementação de IA na prática clínica ao unificar a compreensão de imagens médicas 2D e 3D. O sistema possui um codificador visual em cascata composicional com um operador de Fusão de Localidade Espacialmente Consciente em Cascata e inclui um novo framework de avaliação composto por MedIF-Bench e métricas fundamentadas na região de interesse.
- ClinFusion estabelece um novo estado da arte em 20 dos 24 benchmarks, superando modelos de código aberto como Hulu-Med e Lingshu.
- Demonstra capacidades multimodais superiores aos modelos proprietários GPT-5.2 e Gemini-3-Flash em 13 dos 16 benchmarks.
- O modelo suporta uso de ferramentas agenticas para fluxos de trabalho clínicos com recuperação aumentada e assistência por ferramentas.
- Avaliações cegas por radiologistas certificados pelo conselho confirmam que o ClinFusion produz os relatórios melhor classificados.
- A métrica proposta fundamentada na RoI mostra a correlação mais forte com o julgamento de especialistas entre as métricas de avaliação automática.
Os autores consideram isso significativo porque fornece um método de avaliação alinhado clinicamente e orientado pela factualidade, validando que a saída do seu modelo está alinhada de perto com o julgamento de radiologistas especialistas.