Исследование сравнило клиническую систему искусственного интеллекта Doctorina с участием восьми врачей и четырех автономных передовых языковых моделей в рамках 150 синтетических консультаций по первичной медико-санитарной помощи на польском языке.

  • Doctorina достигла показателя согласованности диагнозов Top-1 на уровне 82,0%, что значительно превосходит результат врачей, составивший 57,0%.
  • Система ИИ показала согласованность с основным или справочным дифференциальным диагнозом на уровне 97,3% по сравнению с 85,0% у врачей.
  • Нормализованные оценки обследования и лечения были выше для Doctorina (89,4 и 83,7), чем для врачей (66,9 и 61,2).
  • Kimi K3 занял следующее место в диагностике, а Claude Opus 5 лидировал в оценках ведения пациента среди близко расположенных ведущих результатов.

Результаты указывают на то, что преимущество Doctorina распространяется от выбора первичного диагноза до более качественной диагностики и начального лечения после адаптивной консультации.