Pesquisadores apresentam o ClinFusion, um modelo de linguagem grande multimodal centrado na visão, projetado para compreensão médica holística que unifica a análise de imagens 2D e nativas em 3D. O sistema utiliza um codificador visual em cascata composicional com um operador de Fusão de Localidade Espacialmente Consciente em Cascata para enfrentar os desafios da imagem médica heterogênea.

  • ClinFusion supera modelos open-source líderes como Hulu-Med e Lingshu em 20 dos 24 benchmarks, incluindo perguntas e respostas visuais e geração de relatórios.
  • Demonstra capacidades multimodais superiores aos modelos proprietários como GPT-5.2 e Gemini-3-Flash em 13 dos 16 benchmarks.
  • Os autores propõem o MedIF-Bench para avaliação de seguimento de instruções e um método fundamentado na região de interesse para avaliação de relatórios orientada pela factualidade.
  • Uma avaliação cega por radiologistas certificados pelo conselho confirmou que o ClinFusion produziu os relatórios melhor classificados, validando a correlação da nova métrica fundamentada em RoI com o julgamento de especialistas.

ClinFusion estabelece um novo estado da arte em benchmarks médicos abrangentes e pode ser aumentado com uso de ferramentas agênticas para fluxos de trabalho clínicos com recuperação aumentada.