शोधकर्ताओं ने GPQA प्रस्तुत किया है, जो जीव विज्ञान, भौतिकी और रसायन विज्ञान में क्षेत्र विशेषज्ञों द्वारा लिखे गए 448 बहुविकल्पीय प्रश्नों का एक चुनौतीपूर्ण डेटासेट है। बेंचमार्क को अत्यंत कठिन बनाया गया है; पीएचडी-स्तर के विशेषज्ञ केवल 65% सटीकता प्राप्त करते हैं, जबकि कुशल गैर-विशेषज्ञ तकनीकी रूप से भी 34% तक पहुंचते हैं, भले ही उन्हें असीमित वेब एक्सेस हो। शीर्ष AI प्रणालियां भी संघर्ष कर रही हैं, जिसमें सबसे मजबूत GPT-4 बेलाइन केवल 39% सटीकता प्राप्त करती है। मानव और फ्रंटियर मॉडल दोनों के लिए इस कठिनाई का उद्देश्य वैज्ञानिक ज्ञान विकास में AI आउटपुट की निगरानी के लिए यथार्थवादी स्केलेबल ओवरसाइट प्रयोगों को सक्षम बनाना है।
GPQA: एक ग्रेजुएट-स्तर का Google-प्रूफ Q&A बेंचमार्क
Benchmarks
| Benchmark | मॉडल | स्कोर |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
शोधकर्ता LLM सहमति अस्पष्टता को हल करने के लिए एक स्वतंत्र टिप्पणीकार की तलाश में है
एक शोधकर्ता 100 तुर्की कथात्मक दृश्यों को लेबल करने के लिए एक एकल स्वतंत्र मानव टिप्पणीकार का अनुरोध कर रहे हैं ताकि यह निर्धारित किया जा सके कि कम इंटर-रेटर सहमति कार्य की व्याख्यात्मक प्रकृति से उत्पन्न होती है या अधूरी टिप्पणी परिभाषाओं से। अध्ययन में पाया गया कि चार LLMs और एक नियम-आधारित डिटेक्टर एक-दूसरे और मानव संदर्भ के साथ लगभग संयोग स्तर पर सहमत थे, जिसमें Cohen’s κ स्कोर 0.000 से 0.185 तक थे।
अध्ययन में ऐसे FragileTokens की पहचान हुई हैं जो अलगाव परीक्षणों में सफल होते हुए भी संदर्भित प्रतिलिपिकरण में विफल रहते हैं
एक अध्ययन ने "FragileTokens" का वर्णन किया है, जो ओपन-वेट भाषा मॉडलों में शब्दावली के एंट्री हैं जो अलग होने पर सफलतापूर्वक प्रतिलिपि बनाते हैं लेकिन आसपास के पाठ में शामिल होने पर त्रुटियां दिखाते हैं। शोध से पता चलता है कि साधारण अलगाव परीक्षणों द्वारा शाब्दिक पहचान की सुरक्षा सुनिश्चित नहीं होती, क्योंकि टोकन अनुक्रमों के भीतर हटाए जा सकते हैं, प्रतिस्थापित किए जा सकते हैं या काटे जा सकते हैं।
GPT-5 और GPT-5 Nano सूक्ष्मजीव ऑन्कोजेनेसिस शोध मूल्यांकन में विशेषज्ञों के बराबर
एक अध्ययन दिखाता है कि GPT-5 और GPT-5 Nano सूक्ष्मजीव ऑन्कोजेनेसिस पर शोध प्रकाशनों से सबूत निकालने और उनका आलोचनात्मक मूल्यांकन करने में विशेषज्ञ-स्तर की कार्यक्षमता हासिल करते हैं। शोधकर्ताओं ने MMTV-LV और स्तन कैंपर पर केंद्रित 24 प्रलेखनों के डेटासेट का उपयोग करके इन मॉडलों का मूल्यांकन डोमेन विशेषज्ञों के साथ Gemini 2.5 Pro और Gemini 2.5 Flash के साथ किया।
GPT-5 और GPT-5 Nano सूक्ष्मजीव उत्पट्टी में कैंसर के सबूत निकालने में विशेषज्ञों के बराबर
सूक्ष्मजीव उत्पट्टी में कैंसर के लिए व्यवस्थित सबूत संश्लेषण पर बड़े भाषा मॉडलों का मूल्यांकन करने वाले एक अध्ययन ने पाया कि GPT-5 और GPT-5 Nano क्षेत्र विशेषज्ञों से अविभेद्य रूप से प्रदर्शन करते हैं। शोधकर्ताओं ने 24 शोध पत्रों पर Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, और GPT-5 Nano का मूल्यांकन कई प्रश्न प्रकारों में 77 आइटम वाले एक संरचित टेम्पलेट का उपयोग करके किया।
M$^3$R-Bench बहुआयामी रूपक समझ के लिए प्रमाण-आधारित मानदंड का परिचय देता है
शोधकर्ताओं ने M$^3$R-Bench पेश किया, एक एकीकृत मानदंड जिसमें 1,000 छवि-पाठ उदाहरण शामिल हैं, जिनमें प्रमाण-आधारित बहुआयामी रूपक समझ का मूल्यांकन करने के लिए मानव-सत्यापित टिप्पणियाँ दी गई हैं। यह मानदंड रूपक की उपस्थिति, लक्ष्य-स्रोत मैपिंग, भावनात्मक स्थिति और अवधारणात्मक रूपक सिद्धांत पर आधारित चरण-दर-चरण व्याख्याओं के लिए संयुक्त टिप्पणियाँ प्रदान करता है।