يقدم الباحثون GPQA، وهو مجموعة بيانات صعبة تحتوي على 448 سؤالاً متعدد الخيارات كتبها خبراء في مجالات الأحياء والفيزياء والكيمياء. تم تصميم المعيار ليكون صعبًا للغاية؛ حيث يحقق الخبراء بمستوى الدكتوراه دقة تبلغ 65% فقط، بينما يصل غير الخبراء المهرة إلى 34% حتى مع الوصول غير المقيد إلى الويب. تواجه أنظمة الذكاء الاصطناعي المتطورة أيضًا صعوبات، حيث تحقق أقوى خط أساس لـ GPT-4 دقة تبلغ 39% فقط. يهدف هذا الصعوبة لكل من البشر والنماذج الحدودية إلى تمكين تجارب مراقبة قابلة للتوسع وواقعية للإشراف على مخرجات الذكاء الاصطناعي في تطوير المعرفة العلمية.