一项研究表明,GPT-5和GPT-5 Nano在提取证据和批判性评估微生物致癌研究出版物方面达到了专家级水平。研究人员使用包含24篇聚焦于MMTV-LV和乳腺癌的论文的数据集,将这些模型与Gemini 2.5 Pro和Gemini 2.5 Flash以及领域专家进行了基准测试。
- 评估使用了包含77个条目的结构化模板,涵盖多种问题类型,包括多项选择题、李克特量表和自由文本回复。
- GPT-5和GPT-5 Nano生成的分数分布与人类专家无法区分,而Gemini模型在应用标准时明显更为宽松。
- 所有模型的幻觉现象都很少见,但在全文中的方法学评估和矛盾识别方面仍存在持续的薄弱环节。
研究结果支持使用LLM进行自动化的系统证据综合,但针对复杂的方法学任务仍需进一步加强。