Microsoft Research a présenté CARE-X, un modèle de recherche conçu pour combler les lacunes des modèles vision-langage actuels en radiologie en associant la génération de rapports génératifs à des prédictions diagnostiques calibrées. Le système utilise l'apprentissage par renforcement (DAPO) pour récompenser l'exactitude clinique et associe le modèle Qwen3-VL-4B-Instruct à des outils de mesure déterministes afin d'évaluer les performances sur des pathologies nécessitant des calculs précis.

  • CARE-X combine un encodeur visuel SigLIP2-so400M et un modèle linguistique Phi-4-mini-instruct (3.8B), enrichi de têtes auxiliaires spécifiques à la tâche pour la classification et l'ancrage visuel.
  • Le modèle emploie une inférence double, produisant à la fois des réponses en texte libre et des prédictions structurées avec des scores de confiance lors d'un seul passage avant-arrière.
  • L'entraînement implique un pipeline de réglage fin supervisé en trois étapes suivi d'un apprentissage par renforcement basé sur DAPO pour optimiser les récompenses liées au rapport clinique et à la précision diagnostique.
  • Une expérience distincte a associé Qwen3-VL-4B-Instruct à des outils de mesure déterministes pour calculer les largeurs cardiaques et thoraciques, comparant le calcul direct à l'approximation visuelle.
  • Le modèle a été validé sur des données cliniques réelles indiennes provenant de Narayana Health, incluant des pathologies rares en soins intensifs et des conditions d'élargissement confirmées par scanner.

CARE-X vise à fournir une approche unifiée qui prend en charge divers flux de travail en radiologie tout en maintenant la fidélité clinique, répondant au besoin à la fois de génération de rapports expressifs et de sorties diagnostiques précises avec seuils ajustables.