सूक्ष्मजीव उत्पट्टी में कैंसर के लिए व्यवस्थित सबूत संश्लेषण पर बड़े भाषा मॉडलों का मूल्यांकन करने वाले एक अध्ययन ने पाया कि GPT-5 और GPT-5 Nano क्षेत्र विशेषज्ञों से अविभेद्य रूप से प्रदर्शन करते हैं। शोधकर्ताओं ने 24 शोध पत्रों पर Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, और GPT-5 Nano का मूल्यांकन कई प्रश्न प्रकारों में 77 आइटम वाले एक संरचित टेम्पलेट का उपयोग करके किया।
- LLM के उत्तर सभी प्रश्न प्रकारों में विशेषज्ञों के साथ निकटता से सहमत थे, जिसमें MCQ, Likert-स्केल, बहु-चयन और मुक्त-पाठ शामिल हैं।
- GPT-5 और GPT-5 Nano ने मानव विशेषज्ञों से सांख्यिकीय रूप से अविभेद्य स्कोर वितरण प्राप्त किए।
- Gemini मॉडल समान व्यवहार प्रदर्शित करते थे लेकिन सूक्ष्मजीव उत्पट्टी मापदंडों को लागू करने में काफी अधिक सहुलियतपूर्ण थे।
- भ्रम दुर्लभ थे, हालांकि पद्धतिगत मूल्यांकन और विरोधाभास की पहचान सभी मॉडलों के लिए निरंतर कमजोरियां बनी हुई थीं।
परिणाम सूक्ष्मजीव-कैंसर जोड़ों की पहचान के लिए स्वचालित व्यवस्थित सबूत संश्लेषण में LLMs के उपयोग का समर्थन करते हैं, हालांकि जटिल पूर्ण-पाठ विश्लेषण कार्यों के लिए और मजबूती की आवश्यकता है।