शोधकर्ताओं ने GPQA प्रस्तुत किया है, जो जीव विज्ञान, भौतिकी और रसायन विज्ञान में क्षेत्र विशेषज्ञों द्वारा लिखे गए 448 बहुविकल्पीय प्रश्नों का एक चुनौतीपूर्ण डेटासेट है। बेंचमार्क को अत्यंत कठिन बनाया गया है; पीएचडी-स्तर के विशेषज्ञ केवल 65% सटीकता प्राप्त करते हैं, जबकि कुशल गैर-विशेषज्ञ तकनीकी रूप से भी 34% तक पहुंचते हैं, भले ही उन्हें असीमित वेब एक्सेस हो। शीर्ष AI प्रणालियां भी संघर्ष कर रही हैं, जिसमें सबसे मजबूत GPT-4 बेलाइन केवल 39% सटीकता प्राप्त करती है। मानव और फ्रंटियर मॉडल दोनों के लिए इस कठिनाई का उद्देश्य वैज्ञानिक ज्ञान विकास में AI आउटपुट की निगरानी के लिए यथार्थवादी स्केलेबल ओवरसाइट प्रयोगों को सक्षम बनाना है।