一项研究将临床AI系统Doctorina与8名医生和4个独立的领先语言模型进行了比较,测试场景为150次合成的波兰语初级保健咨询。
- Doctorina实现了82.0%的Top-1诊断一致性,显著超越了医生的57.0%表现。
- AI系统与主要或参考鉴别诊断的一致性达到97.3%,而医生为85.0%。
- Doctorina的标准化诊疗和评分高于医生(分别为89.4和83.7 vs 66.9和61.2)。
- Kimi K3在诊断方面排名次之,而Claude Opus 5在紧密排列的主要表现者中在管理评估方面领先。
结果表明,Doctorina的优势从初级诊断选择延伸到更高评分的诊断诊疗和适应性咨询后的初始治疗。