Une étude a comparé le système d'IA clinique Doctorina à huit médecins et quatre modèles de langage frontaliers autonomes sur 150 consultations synthétiques de soins primaires en polonais.
- Doctorina a atteint une concordance diagnostique Top-1 de 82,0 %, surpassant significativement la performance des médecins à 57,0 %.
- Le système d'IA a atteint une concordance avec le différentiel primaire ou de référence de 97,3 % par rapport à 85,0 % pour les docteurs.
- Les scores normalisés de travail et de traitement étaient plus élevés pour Doctorina (89,4 et 83,7) que pour les médecins (66,9 et 61,2).
- Kimi K3 a occupé la prochaine place dans les diagnostics, tandis que Claude Opus 5 a mené les estimations de gestion parmi les principaux résultats proches.
Les résultats indiquent que l'avantage de Doctorina s'étend de la sélection du diagnostic primaire à un travail diagnostique et un traitement initial mieux évalués suite à une consultation adaptative.