أظهرت دراسة تقارن النماذج اللغوية الكبيرة في التوليف المنهجي للأدلة الخاصة بالتكوّن الورمي الميكروبي أن GPT-5 و GPT-5 Nano يؤديان أداءً لا يمكن تمييزه عن أداء الخبراء في المجال. قام الباحثون بتقييم Gemini 2.5 Pro، و Gemini 2.5 Flash، و GPT-5، و GPT-5 Nano على 24 ورقة بحثية باستخدام قالب منظم يتكون من 77 عنصرًا عبر أنواع متعددة من الأسئلة.

  • تطابقت إجابات النماذج اللغوية الكبيرة مع الخبراء بشكل وثيق عبر جميع أنواع الأسئلة، بما في ذلك الاختيار من متعدد (MCQ)، ومقياس ليكرت، واختيار متعدد الخيارات، وتنسيقات النص الحر.
  • حققت GPT-5 و GPT-5 Nano توزيعات درجات لا يمكن تمييزها إحصائيًا عن الخبراء البشر.
  • تصرفت نماذج Gemini بشكل مشابه، لكنها كانت أكثر تساهلاً بشكل ملحوظ في تطبيق معايير التكوّن الورمي الميكروبي.
  • كانت الهلوسات نادرة، رغم أن التقييم المنهجي وتحديد التناقضات ظلت نقاط ضعف مستمرة لجميع النماذج.

تدعم النتائج استخدام النماذج اللغوية الكبيرة للتوليف المنهجي الآلي للأدلة لتحديد أزواج الميكروبات والسرطان، على الرغم من الحاجة إلى مزيد من التقوية لمهام تحليل النص الكامل المعقدة.