Un documento de trabajo de Joseph JM Walker evalúa modelos de lenguaje de vanguardia en un benchmark de criptografía literaria multi-canal inédito incrustado en la novela física "I Wrote a Book and Made a Million Dollars (I.B. Wryten)." El estudio encuentra que GPT-5.6 reconoció independientemente el canal de comunicación secundario y recuperó aproximadamente el 95% del material incrustado en su primer pase, mientras que los modelos anteriores demostraron una capacidad efectivamente del 0%.
- Los modelos anteriores fallaron al identificar o resolver la capa criptográfica del libro, con algunos sistemas como Fable y Claude Opus declinando continuar debido a comportamiento de guardarrail.
- GPT-5.6 distinguió teorías provisionales de hallazgos establecidos y mantuvo un registro de teorías en crecimiento mientras conectaba pistas a lo largo de cientos de páginas.
- El benchmark consiste en más de sesenta mecanismos intencionalmente incrustados, incluyendo código Morse, cifrado Vigenère, esteganografía tipográfica y texto de bajo contraste.
- El protocolo de evaluación implicó lectura secuencial sin una clave de respuestas ni ubicaciones de cifrado, probando la capacidad del modelo para realizar reconocimiento de señales bajo ambigüedad.
Los autores consideran este resultado significativo porque marca un salto cualitativo desde ninguna capacidad criptográfica demostrada hasta el razonamiento criptográfico sostenido y altamente capaz dentro de una sola generación del modelo.