Sebuah makalah kerja oleh Joseph JM Walker mengevaluasi model bahasa frontier pada benchmark kriptografi sastra multi-saluran yang belum pernah dilihat sebelumnya, yang tertanam dalam novel fisik "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." Studi ini menemukan bahwa GPT-5.6 secara mandiri mengenali saluran komunikasi sekunder dan memulihkan sekitar 95% materi yang disematkan pada percobaan pertama, sedangkan model-model sebelumnya menunjukkan kemampuan efektif 0%.
- Model-model sebelumnya gagal mengidentifikasi atau memecahkan lapisan kriptografi buku tersebut, dengan beberapa sistem seperti Fable dan Claude Opus menolak untuk melanjutkan karena perilaku penjaga keamanan.
- GPT-5.6 membedakan teori provisional dari temuan yang mapan dan mempertahankan buku catatan teori yang terus berkembang sambil menghubungkan petunjuk di ratusan halaman.
- Benchmark ini terdiri dari lebih dari enam puluh mekanisme yang disengaja disematkan, termasuk kode Morse, enkripsi Vigenère, steganografi tipografis, dan teks dengan kontras rendah.
- Protokol evaluasi melibatkan pembacaan berurutan tanpa kunci jawaban atau lokasi sandi, menguji kemampuan model untuk melakukan pengenalan sinyal dalam kondisi ambigu.
Para penulis menganggap hasil ini signifikan karena menandai lompatan kualitatif dari tidak adanya kemampuan kriptografi yang terbukti menjadi penalaran kriptografi yang berkelanjutan dan sangat mampu dalam satu generasi model.