Pencipta Grand Coder melaporkan evaluasi historis internal yang bertujuan membantu model AI yang mampu bernalar dan bekerja lebih tekun, bukan membuat model itu sendiri lebih cerdas. Studi teknik bertingkat awalnya menjalankan 96 eksekusi terisolasi tetapi mengecualikan dua keluarga tugas karena persyaratan tersembunyi yang tidak valid, menyisakan 72 jalanan untuk analisis.
- Baseline lulus 13 dari 18 tugas, sementara tiga konfigurasi Grand Coder masing-masing lulus 16/18, 16/18, dan 15/18.
- Peningkatan terkonsentrasi pada dua keluarga tugas yang dipertahankan, dengan empat lainnya sudah lulus dalam setiap kondisi.
- Evaluasi lain menunjukkan tes jenuh tanpa perbedaan atau kemenangan tampak yang hilang setelah koreksi skor.
- Skor tinjauan buta meningkat dalam satu studi build, tetapi tes perilaku yang dikoreksi tidak menunjukkan keunggulan pada biaya lebih tinggi.
Penulis menyimpulkan bahwa Grand Coder telah menghasilkan manfaat terukur spesifik yang berguna untuk pekerjaan berkelanjutan, menekankan perlunya memisahkan kesan reviewer dari pemeriksaan perilaku aktual dan biaya. Implementasinya tetap privat, membatasi verifikasi independen atas temuan ini.