Un estudio que evalúa modelos de lenguaje grandes en la síntesis sistemática de evidencia para la oncogénesis microbiana encontró que GPT-5 y GPT-5 Nano se desempeñan de manera indistinguible de los expertos del dominio. Los investigadores evaluaron Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 y GPT-5 Nano en 24 artículos de investigación utilizando una plantilla estructurada de 77 elementos a través de múltiples tipos de preguntas.
- Las respuestas de los LLM se alinearon estrechamente con las de los expertos en todos los tipos de preguntas, incluyendo MCQ, escala de Likert, selección múltiple y formatos de texto libre.
- GPT-5 y GPT-5 Nano lograron distribuciones de puntuación estadísticamente indistinguibles de las de los expertos humanos.
- Los modelos Gemini se comportaron de manera similar, pero fueron significativamente más indulgentes al aplicar los criterios de oncogénesis microbiana.
Las alucinaciones fueron raras, aunque la evaluación metodológica y la identificación de contradicciones siguieron siendo vulnerabilidades persistentes para todos los modelos.
Los resultados respaldan el uso de LLMs para la síntesis automatizada de evidencia sistemática con el fin de identificar pares microbio-cáncer, aunque se necesita un fortalecimiento adicional para tareas de análisis de texto completo complejas.