يحدد المؤلفون أن تراجُع النتائج على معيار SciCode ينجم عن عيوب كبيرة في أداة التقييم وليس عن قيود في قدرة النموذج. كشف تدقيق من خبراء المجال لـ 65 مشكلة اختبارية عن 263 عيبًا، تسبب 192 منها في رفض الحلول الصحيحة بشكل خاطئ بسبب مشكلات مثل إجابات مرجعية غير قابلة للتكرار وتسامحات ضيقة للغاية.

  • صحّح الفريق كل عيب يمكن تأكيده لإنشاء SciCode-Verified، مضيفًا المواصفات اللازمة وإصلاح منطق التقييم.
  • أظهرت إعادة تقييم اثني عشر لقطة من النماذج المتقدمة على المعيار المصحّح ارتفاع دقة المشكلات الفرعية من 45–60% إلى 84–98%.
  • ارتفعت دقة المشكلة الرئيسية بشكل كبير من 9–27% إلى 69–92%, مما يوضح أن النماذج الرائدة أكثر كفاءة بكثير مما كان يُعتقد سابقًا.

أطلق المؤلفون SciCode-Verified مع سجل التدقيق الكامل كمعيار عام مصحّح، مؤكدين أن الاختناق السابق كان يعود إلى جودة أداة التقييم.