微生物発がんに関する体系的エビデンス合成における大規模言語モデルのベンチマーク研究により、GPT-5およびGPT-5 Nanoがドメインの専門家と区別できないほど高いパフォーマンスを発揮することが明らかになった。研究者らは、Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5、GPT-5 Nanoを、複数の質問タイプにわたる77項目からなる構造化テンプレートを用いて24の研究論文で評価した。
- LLMの回答は、MCQ、リッカート尺度、複数選択、自由記述などのすべての質問タイプにおいて、専門家と非常に一致していた。
- GPT-5およびGPT-5 Nanoは、人間専門家と統計的に区別できないスコア分布を達成した。
- Geminiモデルも同様の挙動を示したが、微生物発がん基準の適用において著しく寛容であった。
- 幻覚は稀であったが、方法論的評価や矛盾の特定はすべてのモデルにおいて持続的な脆弱性として残った。
これらの結果は、微生物とがんのペアを特定するための自動化された体系的エビデンス合成におけるLLMの利用を支えるものであるが、複雑な全文分析タスクについてはさらなる強化が必要である。