Исследование, оценивающее большие языковые модели при систематическом синтезе доказательств по микробному онкогенезу, показало, что GPT-5 и GPT-5 Nano работают неотличимо от экспертов в этой области. Исследователи оценивали Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 и GPT-5 Nano на основе 24 научных статей с использованием структурированного шаблона из 77 пунктов по нескольким типам вопросов.
- Ответы LLM были тесно согласованы с ответами экспертов по всем типам вопросов, включая MCQ, шкалу Лайкерта, множественный выбор и свободный текст.
- GPT-5 и GPT-5 Nano достигли распределения оценок, статистически неотличимого от оценок человеческих экспертов.
Модели Gemini вели себя аналогично, но были значительно более снисходительны при применении критериев микробного онкогенеза.
- Галлюцинации встречались редко, хотя оценка методологии и выявление противоречий оставались устойчивыми уязвимостями для всех моделей.
Результаты подтверждают использование LLM для автоматизированного систематического синтеза доказательств с целью выявления пар «микроб-рак», хотя требуется дальнейшее усиление возможностей для сложных задач анализа полного текста.