Microsoft Research ha presentado CARE-X, un modelo de investigación diseñado para abordar las lagunas en los actuales modelos de visión-lenguaje de radiología al combinar la generación de informes generativos con predicciones diagnósticas calibradas. El sistema utiliza aprendizaje por refuerzo (DAPO) para recompensar la corrección clínica y empareja el modelo Qwen3-VL-4B-Instruct con herramientas de medición deterministas para evaluar el rendimiento en condiciones que requieren cálculos precisos.
- CARE-X combina un codificador visual SigLIP2-so400M y un modelo de lenguaje Phi-4-mini-instruct (3.8B), aumentado con cabezales auxiliares específicos de la tarea para clasificación y anclaje visual.
- El modelo emplea inferencia dual, produciendo tanto respuestas de texto libre como predicciones estructuradas con puntuaciones de confianza en un solo pase hacia adelante.
- El entrenamiento implica una tubería de ajuste fino supervisado en tres etapas seguida de aprendizaje por refuerzo basado en DAPO para optimizar las recompensas para la generación de informes clínicos y la precisión diagnóstica.
- Un experimento separado emparejó Qwen3-VL-4B-Instruct con herramientas de medición deterministas para calcular los anchos cardíaco y torácico, comparando el cálculo directo contra la aproximación visual.
- El modelo fue validado en datos clínicos reales de la India de Narayana Health, incluidas patologías raras de UCI y condiciones de agrandamiento confirmadas por TC.
CARE-X tiene como objetivo proporcionar un enfoque unificado que apoye diversos flujos de trabajo de radiología mientras mantiene la fidelidad clínica, abordando la necesidad tanto de generación de informes expresivos como de salidas diagnósticas precisas y ajustables por umbral.