一项针对大型语言模型在微生物致癌系统性证据合成方面的基准测试发现,GPT-5 和 GPT-5 Nano 的表现与领域专家难以区分。研究人员使用包含多个问题类型的77项结构化模板,对 Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5 和 GPT-5 Nano 在24篇研究论文上进行了评估。

  • 在所有问题类型(包括多项选择题、李克特量表、多选和自由文本格式)中,LLM 的回答与专家高度一致。
  • GPT-5 和 GPT-5 Nano 获得的分数分布与人类专家的统计结果难以区分。
  • Gemini 模型表现相似,但在应用微生物致癌标准时显著更为宽松。
  • 幻觉现象罕见,但方法学评估和矛盾识别仍是所有模型的持续薄弱环节。

结果表明,LLM 可用于自动化系统性证据合成以识别微生物-癌症配对,尽管在复杂全文分析任务方面仍需进一步加强。