लेखकों ने पहचाना कि SciCode बेंचमार्क पर स्कोर में रुकावट का कारण मॉडल क्षमता की सीमाएं नहीं, बल्कि मूल्यांकन उपकरण में महत्वपूर्ण त्रुटियां हैं। 65 परीक्षण समस्याओं के एक क्षेत्र विशेषज्ञ द्वारा किए गए ऑडिट में 263 त्रुटियां पाई गईं, जिनमें से 192 ने गैर-पुनरुत्पादित स्वर्ग उत्तरों और अत्यधिक कठोर सहिष्णुता जैसे मुद्दों के कारण सही समाधानों को गलत तरीके से अस्वीकार कर दिया।
- टीम ने प्रत्येक पुष्टि योग्य त्रुटि को ठीक करके SciCode-Verified बनाया, आवश्यक विनिर्देश जोड़े और ग्रेडिंग तर्क की मरम्मत की।
- सुधारे गए बेंचमार्क पर बारह अग्रणी मॉडल स्नैपशॉट का पुनर्मूल्यांकन करने से उप-समस्या सटीकता 45–60% से बढ़कर 84–98% हो गई।
- मुख्य समस्या की सटीकता में 9–27% से 69–92% तक महत्वपूर्ण वृद्धि हुई, जो दर्शाती है कि राज्य-के-अंतर्गत मॉडल पहले सुझाए गए की तुलना में कहीं अधिक कुशल हैं।
लेखक SciCode-Verified को अपने पूर्ण ऑडिट ट्रेल के साथ सुधारे गए सार्वजनिक मानक के रूप में जारी करते हैं, यह स्थापित करते हुए कि पिछली बाधा मूल्यांकन उपकरण की गुणवत्ता थी।