Исследование показывает, что GPT-5 и GPT-5 Nano достигают экспертного уровня производительности при извлечении доказательств и критической оценке научных публикаций по микробной онкогенезу. Исследователи провели бенчмаркинг этих моделей вместе с Gemini 2.5 Pro и Gemini 2.5 Flash на наборе данных из 24 статей, посвящённых MMTV-LV и раку молочной железы, по сравнению с экспертами в данной области.

  • Оценка использовала структурированный шаблон с 77 пунктами по нескольким типам вопросов, включая MCQ, шкалы Лайкерта и свободные текстовые ответы.
  • GPT-5 и GPT-5 Nano выдали распределение оценок, неразличимое от оценок экспертов-людей, в то время как модели Gemini были значительно более снисходительны при применении критериев.
  • Галлюцинации встречались редко во всех моделях, однако оценка методологии и выявление противоречий внутри полных текстов оставались устойчивыми уязвимостями.

Полученные результаты поддерживают использование LLM для автоматизированного систематического синтеза доказательств, хотя требуется дальнейшее усиление в сложных методологических задачах.