ある研究では、臨床AIシステムDoctorinaを8人の医師と4つのスタンドアロンフロンティア言語モデルと比較し、150件の合成ポルトガル語一次保健相談で行われた。
- Doctorinaは82.0%のTop-1診断一致率を達成し、医師の57.0%のパフォーマンスを大幅に上回った。
- AIシステムは主要または参照差分一致率で97.3%に達し、医師の85.0%と比較して優れていた。
- 正規化された診察および治療スコアはDoctorina(89.4および83.7)の方が医師(66.9および61.2)よりも高かった。
- Kimi K3は診断で次にランクされ、Claude Opus 5は緊密に並んだ上位パフォーマンスの中で管理見積もりをリードした。
結果は、Doctorinaの優位性が一次診断の選択から、適応型相談後のより高い評価の診断診察および初期治療まで及んでいることを示している。