تُظهر دراسة تدقق فيها ستة معايير فيزيائية مستخدمة على نطاق واسع أن الدرجات المنخفضة المبلغ عنها للنماذج اللغوية المتقدمة تعزى بشكل كبير لأخطاء في التقييم وليس لنقص في قدرات النموذج. راجع الخبراء عبارات المشكلات والحلول المرجعية واستجابات النماذج، لتمييز الأخطاء الحقيقية عن أخطاء المصححين والمراجع غير الصحيحة والأسئلة الغامضة.

  • ارتفع متوسط GPT-5.6-Sol على HLE-Physics من 47.3% إلى 78.7% بعد التصحيح.
  • ارتفعت درجته على CMT-Benchmark من 61.0% إلى 87.2% بعد المراجعة الخبيرة.
  • حقق النموذج معدل نجاح@4 مصححًا بنسبة 94.4% على تحديات CritPt الـ54 المتبقية.
  • ارتفعت الدرجات على UGPhysics وPRISM-Physics وPHYBench أيضًا بشكل كبير بعد التدقيق.

تشير النتائج إلى أن المعايير الحالية تقلل بشكل كبير من تقدير قدرة النماذج المتقدمة على حل مسائل الفيزياء المحددة جيدًا، مما يسلط الضوء على الحاجة إلى تقييمات أكثر صعوبة وموثقة من خبراء.