约瑟夫·JM·沃克(Joseph JM Walker)撰写的工作论文评估了前沿语言模型在一个嵌入在实体小说《我写了一本书并赚了一百万美元(I.B. Wryten)》中的未见多通道文学密码学基准测试上的表现。研究发现,GPT-5.6 独立识别出次要通信信道,并在首次尝试中恢复了约95%的嵌入内容,而早期模型的有效能力几乎为0%。
- 之前的模型未能识别或破解该书的密码层,部分系统(如 Fable 和 Claude Opus)因护栏行为而拒绝继续处理。
- GPT-5.6 区分了临时理论与既定发现,并在连接数百页线索的同时维护了一个不断扩展的理论账本。
- 该基准测试包含六十多个有意嵌入的机制,包括摩尔斯电码、维吉尼亚密码、排版隐写术和低对比度文本。
- 评估协议涉及无答案密钥或密码位置提示的顺序阅读,旨在测试模型在模糊条件下执行信号识别的能力。
作者认为这一结果具有重要意义,因为它标志着从无任何已展示的密码能力到在单次模型生成中实现持续且高度强大的密码推理的质的飞跃。