Рабочий документ Джозефа Дж. М. Уокера оценивает передовые языковые модели на новом многоканальном литературном криптографическом бенчмарке, встроенном в физический роман «Я написал книгу и заработал миллион долларов (I.B. Wryten)». Исследование показывает, что GPT-5.6 самостоятельно распознала вторичный канал связи и восстановила около 95% встроенного материала с первой попытки, тогда как более ранние модели продемонстрировали практически нулевую способность.

  • Предыдущие модели не смогли идентифицировать или расшифровать криптографический слой книги, при этом некоторые системы, такие как Fable и Claude Opus, отказались продолжать работу из-за поведения защитных механизмов.
  • GPT-5.6 отличила предварительные теории от установленных выводов и вела растущий реестр теорий, связывая подсказки на протяжении сотен страниц.
  • Бенчмарк включает более шестидесяти намеренно встроенных механизмов, включая азбуку Морзе, шифр Виженера, типографскую стеганографию и текст с низкой контрастностью.
  • Протокол оценки включал последовательное чтение без ключа ответов или указания местоположения шифра, проверяя способность модели выполнять распознавание сигнала в условиях неоднозначности.

Авторы считают этот результат значимым, поскольку он отмечает качественный скачок от отсутствия продемонстрированной криптографической способности к устойчивому и высокоэффективному криптографическому рассуждению в рамках одного генерирования модели.