Um estudo que avaliou modelos de linguagem grandes na síntese sistemática de evidências para oncogênese microbiana descobriu que o GPT-5 e o GPT-5 Nano têm desempenho indistinguível do de especialistas da área. Os pesquisadores avaliaram o Gemini 2.5 Pro, o Gemini 2.5 Flash, o GPT-5 e o GPT-5 Nano em 24 artigos de pesquisa, utilizando um modelo estruturado com 77 itens em múltiplos tipos de pergunta.
- As respostas dos LLMs alinharam-se estreitamente com as dos especialistas em todos os tipos de pergunta, incluindo MCQ, escala Likert, seleção múltipla e formatos de texto livre.
- O GPT-5 e o GPT-5 Nano alcançaram distribuições de pontuação estatisticamente indistinguíveis das de especialistas humanos.
- Os modelos Gemini comportaram-se de maneira semelhante, mas foram significativamente mais indulgentes ao aplicar os critérios de oncogênese microbiana.
- As alucinações foram raras, embora a avaliação metodológica e a identificação de contradições tenham permanecido vulnerabilidades persistentes para todos os modelos.
Os resultados apoiam o uso de LLMs para síntese automatizada de evidências sistemáticas com o objetivo de identificar pares microrganismo-câncer, embora seja necessário um fortalecimento adicional para tarefas complexas de análise de texto completo.