한 연구는 150건의 합성 폴란드어 일차 진료 상담을 통해 임상 AI 시스템 Doctorina를 8명의 의사 및 4개의 독립형 프론티어 언어 모델과 비교했습니다.

  • Doctorina는 82.0%의 Top-1 진단 일치율을 달성하여 의사의 57.0% 성능을 크게 상회했습니다.
  • AI 시스템은 주요 또는 참조 감별 일치율에서 97.3%에 도달하여 의사들의 85.0%와 비교되었습니다.
  • 정규화된 진료 및 치료 점수는 Doctorina(89.4 및 83.7)가 의사들(66.9 및 61.2)보다 높았습니다.
  • Kimi K3는 진단에서 다음 순위를 차지했으며, Claude Opus 5는 밀집된 상위 성능자들 사이에서 관리 추정치에서 선두를 차지했습니다.

결과들은 Doctorina의 우위가 일차 진단 선택부터 적응형 상담 후 더 높은 평가의 진단 진료 및 초기 치료에 이르기까지 확장됨을 나타냅니다.