يقدم الباحثون GPQA، وهو مجموعة بيانات صعبة تحتوي على 448 سؤالاً متعدد الخيارات كتبها خبراء في مجالات الأحياء والفيزياء والكيمياء. تم تصميم المعيار ليكون صعبًا للغاية؛ حيث يحقق الخبراء بمستوى الدكتوراه دقة تبلغ 65% فقط، بينما يصل غير الخبراء المهرة إلى 34% حتى مع الوصول غير المقيد إلى الويب. تواجه أنظمة الذكاء الاصطناعي المتطورة أيضًا صعوبات، حيث تحقق أقوى خط أساس لـ GPT-4 دقة تبلغ 39% فقط. يهدف هذا الصعوبة لكل من البشر والنماذج الحدودية إلى تمكين تجارب مراقبة قابلة للتوسع وواقعية للإشراف على مخرجات الذكاء الاصطناعي في تطوير المعرفة العلمية.
GPQA: معيار أسئلة وأجوبة على مستوى الدراسات العليا ومقاوم لبحث Google
Benchmarks
| Benchmark | النموذج | الدرجة |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
باحث يبحث عن مُعلِّم مستقل واحد لحل غموض اتفاق نماذج اللغات الكبيرة
يطلب باحث مُعلِّماً بشرياً مستقلاً واحداً لتصنيف 100 مشهد سردي تركي لتحديد ما إذا كان انخفاض اتفاق المقيّمين يعود إلى الطبيعة التفسيرية للمهمة أو إلى تعريفات التضمين غير المحددة بدقة. وجدت الدراسة أن أربعة نماذج لغات كبيرة وكاشفاً قائماً على القواعد اتفق مع بعضها البعض ومع المرجع البشري عند مستوى يقارب الصدفة العشوائية، حيث تراوحت درجات كوهن κ بين 0.000 و0.185.
دراسة تحدد "رموزاً هشة" تفشل في نسخ السياق رغم اجتيازها لفحوصات العزل
تصف دراسة "الرموز الهشة" وهي إدخالات مفردات في نماذج لغوية مفتوحة الوزن تنجح في النسخ عند عزلها لكنها تُظهر أخطاءً عند تضمينها في النص المحيط. تسلط الأبحاث الضوء على أن الحفاظ على الهوية الحرفية غير مضمون من خلال اختبارات العزل القياسية، إذ يمكن حذف الرموز أو استبدالها أو اقتطاعها ضمن التسلسلات.
GPT-5 و GPT-5 Nano يتطابقان مع الخبراء في تقييم أبحاث التكوين الورمي الميكروبي
تُظهر دراسة أن GPT-5 و GPT-5 Nano يحققان أداءً على مستوى الخبراء في استخراج الأدلة وتقييم الأبحاث المنشورة حول التكوين الورمي الميكروبي بشكل نقدي. قام الباحثون بمقارنة هذه النماذج مع Gemini 2.5 Pro و Gemini 2.5 Flash مقابل خبراء متخصصين باستخدام مجموعة بيانات مكونة من 24 ورقة بحثية تركز على MMTV-LV وسرطان الثدي.
GPT-5 و GPT-5 Nano يتطابقان مع الخبراء في استخراج أدلة التكوّن الورمي الميكروبي
أظهرت دراسة تقارن النماذج اللغوية الكبيرة في التوليف المنهجي للأدلة الخاصة بالتكوّن الورمي الميكروبي أن GPT-5 و GPT-5 Nano يؤديان أداءً لا يمكن تمييزه عن أداء الخبراء في المجال. قام الباحثون بتقييم Gemini 2.5 Pro، و Gemini 2.5 Flash، و GPT-5، و GPT-5 Nano على 24 ورقة بحثية باستخدام قالب منظم يتكون من 77 عنصرًا عبر أنواع متعددة من الأسئلة.
يقدم M$^3$R-Bench معيارًا مدعومًا بالأدلة لفهم الاستعارات متعددة الوسائط
يقدم الباحثون M$^3$R-Bench، وهو معيار موحد يحتوي على 1,000 حالة من الصور والنصوص معannotations تم التحقق منها بشريًا مصممة لتقييم فهم الاستعارات متعددة الوسائط المدعوم بالأدلة. يوفر المعيار annotations مشتركة لحدوث الاستعارة، والربط بين الهدف والمصدر، والمشاعر، وشرح خطوة بخطوة بناءً على نظرية الاستعارة المفاهيمية.