Sebuah studi menunjukkan bahwa GPT-5 dan GPT-5 Nano mencapai kinerja tingkat ahli dalam mengekstrak bukti dan melakukan penilaian kritis terhadap publikasi penelitian mengenai onkogenesis mikroba. Para peneliti membandingkan model-model ini bersama Gemini 2.5 Pro dan Gemini 2.5 Flash dengan para ahli domain menggunakan dataset yang terdiri dari 24 makalah yang berfokus pada MMTV-LV dan kanker payudara.

  • Evaluasi menggunakan templat terstruktur dengan 77 item di berbagai jenis pertanyaan, termasuk MCQ, skala Likert, dan respons teks bebas.
  • GPT-5 dan GPT-5 Nano menghasilkan distribusi skor yang tidak dapat dibedakan dari para ahli manusia, sementara model-model Gemini jauh lebih longgar dalam menerapkan kriteria.
  • Hallusinasi jarang terjadi pada semua model, namun penilaian metodologis dan identifikasi kontradiksi dalam teks lengkap tetap menjadi kerentanan yang persisten.

Temuan ini mendukung penggunaan LLM untuk sintesis bukti sistematis otomatis, meskipun penguatan lebih lanjut diperlukan untuk tugas-tugas metodologis yang kompleks.