Un article de travail de Joseph JM Walker évalue les modèles de langage de pointe sur un benchmark de cryptographie littéraire multi-canaux inédit, intégré dans le roman physique « I Wrote a Book and Made a Million Dollars (I.B. Wryten) ». L'étude révèle que GPT-5.6 a identifié indépendamment le canal de communication secondaire et récupéré environ 95 % du matériel intégré lors de son premier passage, tandis que les modèles antérieurs ont démontré une capacité effectivement nulle.
- Les modèles précédents ont échoué à identifier ou résoudre la couche cryptographique du livre, certains systèmes comme Fable et Claude Opus ayant refusé de poursuivre en raison d'un comportement de garde-fou.
- GPT-5.6 a distingué les théories provisoires des résultats établis et a maintenu un registre de théorie croissant tout en reliant les indices sur des centaines de pages.
- Le benchmark comprend plus de soixante mécanismes intentionnellement intégrés, y compris le code Morse, le chiffrement Vigenère, la stéganographie typographique et le texte à faible contraste.
- Le protocole d'évaluation impliquait une lecture séquentielle sans clé de réponse ni localisation des chiffrements, testant la capacité du modèle à effectuer une reconnaissance de signal dans l'ambiguïté.
Les auteurs considèrent ce résultat significatif car il marque un bond qualitatif, passant de l'absence de capacité cryptographique démontrée à un raisonnement cryptologique soutenu et hautement capable au sein d'une seule génération de modèle.