Grand Coder के निर्माता ने आंतरिक ऐतिहासिक मूल्यांकनों की रिपोर्ट दी है, जिनका उद्देश्य सक्षम AI मॉडलों को अधिक तार्किक रूप से और परिश्रम से काम करने में मदद करना है, न कि स्वयं मॉडल को अधिक स्मार्ट बनाना। एक पंक्तिबद्ध इंजीनियरिंग अध्ययन ने शुरू में 96 अलग-अलग निष्पादन चलाए, लेकिन अवैध छिपी हुई आवश्यकताओं के कारण दो कार्य परिवारों को बाहर रखा गया, जिससे विश्लेषण के लिए 72 रन शेष रहे।
- बेसलाइन ने 18 में से 13 कार्यों में सफलता प्राप्त की, जबकि तीन Grand Coder कॉन्फ़िगरेशन क्रमशः 16/18, 16/18, और 15/18 में सफल हुए।
- लाभ दो बचे हुए कार्य परिवारों में केंद्रित थे, जबकि अन्य चार पहले से ही हर स्थिति में सफल हो चुके थे।
- अन्य मूल्यांकनों में संतृप्त परीक्षण दिखाई दिए, जिनमें कोई अंतर नहीं था या स्पष्ट जीत स्कोरिंग सुधारों के बाद गायब हो गईं।
- एक बिल्ड अध्ययन में अंधा समीक्षा स्कोर बेहतर हुआ, लेकिन सुधारे गए व्यवहारिक परीक्षणों ने उच्च लागत पर कोई लाभ नहीं दिखाया।
लेखक निष्कर्ष निकालते हैं कि Grand Coder ने विशिष्ट मापने योग्य लाभ उत्पन्न किए हैं जो चल रहे कार्यों के लिए उपयोगी हैं, और समीक्षकों की प्रभावशीलता को वास्तविक व्यवहारिक जाँचों और लागत से अलग करने की आवश्यकता पर जोर देते हैं। कार्यान्वयन अभी भी निजी है, जिससे इन निष्कर्षों की स्वतंत्र सत्यापन सीमित हो जाती है।