ある研究により、GPT-5およびGPT-5 Nanoが、微生物発がんに関する研究論文のエビデンス抽出および批判的評価において専門家レベルのパフォーマンスを達成することが示された。研究者らは、MMTV-LVおよび乳癌に焦点を当てた24編の論文からなるデータセットを用い、これらのモデルをGemini 2.5 ProおよびGemini 2.5 Flashと共にドメイン専門家と比較ベンチマークした。

  • 評価は、MCQ、リッカート尺度、自由記述回答など複数の質問タイプにわたる77項目を含む構造化テンプレートを使用した。
  • GPT-5およびGPT-5 Nanoは人間専門家と区別できないスコア分布を生み出したのに対し、Geminiモデルは基準の適用において有意により寛容であった。
  • 全モデルを通じて幻覚は稀であったが、方法論的評価および全文内での矛盾の特定は持続的な脆弱性であった。

これらの知見は、LLMを自動化された体系的エビデンス合成に使用することを支持するものの、複雑な方法論的タスクについてはさらなる強化が必要である。