Los investigadores presentan ClinFusion, un modelo de lenguaje grande multimodal centrado en la visión diseñado para abordar los desafíos de implementar IA en la práctica clínica al unificar la comprensión de imágenes médicas 2D y 3D. El sistema cuenta con un codificador visual en cascada composicional con un operador de fusión de localidad espacialmente consciente en cascada e incluye un nuevo marco de evaluación que comprende MedIF-Bench y métricas basadas en la región de interés.
- ClinFusion establece un nuevo estado del arte en 20 de los 24 benchmarks, superando a modelos de código abierto como Hulu-Med y Lingshu.
- Demuestra capacidades multimodales superiores a los modelos propietarios GPT-5.2 y Gemini-3-Flash en 13 de los 16 benchmarks.
- El modelo admite el uso de herramientas agénticas para flujos de trabajo clínicos asistidos por herramientas y con recuperación aumentada.
- Las evaluaciones a ciegas por parte de radiólogos certificados confirman que ClinFusion produce los informes mejor clasificados.
- La métrica propuesta basada en RoI muestra la correlación más fuerte con el juicio experto entre las métricas de evaluación automática.
Los autores consideran esto significativo porque proporciona un método de evaluación alineado clínicamente y basado en la factualidad, y valida que la salida de su modelo se alinea estrechamente con el juicio del radiólogo experto.