Un estudio demuestra que GPT-5 y GPT-5 Nano logran un rendimiento de nivel experto en la extracción de evidencia y la evaluación crítica de publicaciones de investigación sobre oncogénesis microbiana. Los investigadores evaluaron estos modelos junto con Gemini 2.5 Pro y Gemini 2.5 Flash frente a expertos del dominio utilizando un conjunto de datos de 24 artículos centrados en MMTV-LV y cáncer de mama.
- La evaluación utilizó una plantilla estructurada con 77 elementos en múltiples tipos de preguntas, incluidas preguntas de opción múltiple (MCQ), escalas de Likert y respuestas de texto libre.
- GPT-5 y GPT-5 Nano produjeron distribuciones de puntuación indistinguibles de las de los expertos humanos, mientras que los modelos Gemini fueron significativamente más indulgentes al aplicar los criterios.
- Las alucinaciones fueron raras en todos los modelos, pero la evaluación metodológica y la identificación de contradicciones dentro de los textos completos siguieron siendo vulnerabilidades persistentes.
Los hallazgos respaldan el uso de LLM para la síntesis automatizada de evidencia sistemática, aunque se necesita un fortalecimiento adicional para tareas metodológicas complejas.