Los investigadores presentan ClinFusion, un modelo de lenguaje grande multimodal centrado en la visión diseñado para una comprensión médica holística que unifica el análisis de imágenes 2D y nativo 3D. El sistema utiliza un codificador visual en cascada composicional con un operador de fusión de localidad espacialmente consciente en cascada para abordar los desafíos de la imagen médica heterogénea.

  • ClinFusion supera a modelos de código abierto líderes como Hulu-Med y Lingshu en 20 de 24 benchmarks, incluyendo preguntas visuales y generación de informes.
  • Demuestra capacidades multimodales superiores a modelos propietarios como GPT-5.2 y Gemini-3-Flash en 13 de 16 benchmarks.
  • Los autores proponen MedIF-Bench para la evaluación del seguimiento de instrucciones y un método basado en regiones de interés para la evaluación factual de informes.
  • Una evaluación ciega por radiólogos certificados confirmó que ClinFusion produjo los informes mejor clasificados, validando la correlación de la nueva métrica basada en RoI con el juicio experto.

ClinFusion establece un nuevo estado del arte en benchmarks médicos integrales y puede ampliarse con uso de herramientas agénticas para flujos de trabajo clínicos aumentados por recuperación.