एक अध्ययन दिखाता है कि GPT-5 और GPT-5 Nano सूक्ष्मजीव ऑन्कोजेनेसिस पर शोध प्रकाशनों से सबूत निकालने और उनका आलोचनात्मक मूल्यांकन करने में विशेषज्ञ-स्तर की कार्यक्षमता हासिल करते हैं। शोधकर्ताओं ने MMTV-LV और स्तन कैंपर पर केंद्रित 24 प्रलेखनों के डेटासेट का उपयोग करके इन मॉडलों का मूल्यांकन डोमेन विशेषज्ञों के साथ Gemini 2.5 Pro और Gemini 2.5 Flash के साथ किया।
- इस मूल्यांकन में MCQs, लिकर्ट स्केल और मुक्त-पाठ प्रतिक्रियाओं सहित कई प्रश्न प्रकारों पर 77 आइटम वाले एक संरचित टेम्पलेट का उपयोग किया गया।
- GPT-5 और GPT-5 Nano ने मानव विशेषज्ञों से अविभेद्य स्कोर वितरण उत्पन्न किए, जबकि Gemini मॉडल मानदंड लागू करने में काफी अधिक सहज थे।
- सभी मॉडलों में हैल्युसिनेशन दुर्लभ थे, लेकिन विधिगत मूल्यांकन और पूर्ण पाठ के भीतर विरोधाभास की पहचान निरंतर कमजोरियां बनी रहीं।
निष्कर्ष स्वचालित व्यवस्थित सबूत संश्लेषण के लिए LLMs के उपयोग का समर्थन करते हैं, हालांकि जटिल विधिगत कार्यों के लिए और मजबूती की आवश्यकता है।