Le créateur de Grand Coder rend compte d'évaluations historiques internes visant à aider les modèles d'IA capables à raisonner et à travailler plus diligentement, plutôt qu'à rendre le modèle lui-même plus intelligent. Une étude d'ingénierie par niveaux a initialement exécuté 96 exécutions isolées mais a exclu deux familles de tâches en raison d'exigences cachées invalides, ne laissant que 72 exécutions pour l'analyse.
- La ligne de base a réussi 13 tâches sur 18, tandis que trois configurations de Grand Coder ont réussi respectivement 16/18, 16/18 et 15/18.
- Les gains se sont concentrés dans deux familles de tâches conservées, les quatre autres ayant déjà été réussies dans toutes les conditions.
- D'autres évaluations ont montré des tests saturés sans différence ou des victoires apparentes qui ont disparu après les corrections de notation.
- Les scores d'examen en aveugle se sont améliorés dans une étude de construction, mais les tests comportementaux corrigés n'ont montré aucun avantage malgré un coût plus élevé.
L'auteur conclut que Grand Coder a produit des bénéfices spécifiques et mesurables utiles pour le travail en cours, soulignant la nécessité de séparer les impressions des examinateurs des vérifications comportementales réelles et des coûts. L'implémentation reste privée, limitant la vérification indépendante de ces résultats.