تُظهر دراسة أن GPT-5 و GPT-5 Nano يحققان أداءً على مستوى الخبراء في استخراج الأدلة وتقييم الأبحاث المنشورة حول التكوين الورمي الميكروبي بشكل نقدي. قام الباحثون بمقارنة هذه النماذج مع Gemini 2.5 Pro و Gemini 2.5 Flash مقابل خبراء متخصصين باستخدام مجموعة بيانات مكونة من 24 ورقة بحثية تركز على MMTV-LV وسرطان الثدي.
- استخدم التقييم قالبًا هيكليًا يحتوي على 77 عنصرًا عبر أنواع متعددة من الأسئلة، بما في ذلك أسئلة الاختيار من متعدد (MCQs)، ومقاييس ليكرت، واستجابات النص الحر.
- أنتج GPT-5 و GPT-5 Nano توزيعات درجات لا يمكن تمييزها عن خبراء البشر، بينما كانت نماذج Gemini أكثر تساهلاً بشكل ملحوظ في تطبيق المعايير.
- كانت الهلوسات نادرة عبر جميع النماذج، لكن التقييم المنهجي وتحديد التناقضات داخل النصوص الكاملة ظلت نقاط ضعف مستمرة.
تدعم النتائج استخدام نماذج اللغات الكبيرة (LLMs) للتركيب التلقائي للأدلة المنهجية، على الرغم من الحاجة إلى مزيد من التقوية للمهام المنهجية المعقدة.