Исследование сравнило клиническую систему искусственного интеллекта Doctorina с участием восьми врачей и четырех автономных передовых языковых моделей в рамках 150 синтетических консультаций по первичной медико-санитарной помощи на польском языке.
- Doctorina достигла показателя согласованности диагнозов Top-1 на уровне 82,0%, что значительно превосходит результат врачей, составивший 57,0%.
- Система ИИ показала согласованность с основным или справочным дифференциальным диагнозом на уровне 97,3% по сравнению с 85,0% у врачей.
- Нормализованные оценки обследования и лечения были выше для Doctorina (89,4 и 83,7), чем для врачей (66,9 и 61,2).
- Kimi K3 занял следующее место в диагностике, а Claude Opus 5 лидировал в оценках ведения пациента среди близко расположенных ведущих результатов.
Результаты указывают на то, что преимущество Doctorina распространяется от выбора первичного диагноза до более качественной диагностики и начального лечения после адаптивной консультации.