Um estudo demonstra que o GPT-5 e o GPT-5 Nano alcançam desempenho de nível especialista na extração de evidências e na avaliação crítica de publicações de pesquisa sobre oncogênese microbiana. Os pesquisadores avaliaram esses modelos junto com Gemini 2.5 Pro e Gemini 2.5 Flash em comparação a especialistas do domínio, utilizando um conjunto de dados com 24 artigos focados em MMTV-LV e câncer de mama.
- A avaliação utilizou um modelo estruturado com 77 itens em múltiplos tipos de perguntas, incluindo MCQs, escalas Likert e respostas de texto livre.
- O GPT-5 e o GPT-5 Nano produziram distribuições de pontuação indistinguíveis das dos especialistas humanos, enquanto os modelos Gemini foram significativamente mais indulgentes na aplicação dos critérios.
As alucinações foram raras em todos os modelos, mas a avaliação metodológica e a identificação de contradições dentro dos textos completos permaneceram vulnerabilidades persistentes.
Os resultados apoiam o uso de LLMs para síntese automatizada de evidências sistemáticas, embora seja necessário um fortalecimento adicional para tarefas metodológicas complexas.