Рабочий документ Джозефа Дж. М. Уокера оценивает передовые языковые модели на новом многоканальном литературном криптографическом бенчмарке, встроенном в физический роман «Я написал книгу и заработал миллион долларов (I.B. Wryten)». Исследование показывает, что GPT-5.6 самостоятельно распознала вторичный канал связи и восстановила около 95% встроенного материала с первой попытки, тогда как более ранние модели продемонстрировали практически нулевую способность.
- Предыдущие модели не смогли идентифицировать или расшифровать криптографический слой книги, при этом некоторые системы, такие как Fable и Claude Opus, отказались продолжать работу из-за поведения защитных механизмов.
- GPT-5.6 отличила предварительные теории от установленных выводов и вела растущий реестр теорий, связывая подсказки на протяжении сотен страниц.
- Бенчмарк включает более шестидесяти намеренно встроенных механизмов, включая азбуку Морзе, шифр Виженера, типографскую стеганографию и текст с низкой контрастностью.
- Протокол оценки включал последовательное чтение без ключа ответов или указания местоположения шифра, проверяя способность модели выполнять распознавание сигнала в условиях неоднозначности.
Авторы считают этот результат значимым, поскольку он отмечает качественный скачок от отсутствия продемонстрированной криптографической способности к устойчивому и высокоэффективному криптографическому рассуждению в рамках одного генерирования модели.