В статье утверждается, что текущее согласование LLM терпит неудачу из-за отсутствия у моделей постоянных затрат и временной непрерывности, что приводит к созданию пустых извинений вместо обучения на основе нарушений ограничений. Предлагается рассматривать человеческое внимание как основной дефицитный ресурс и переопределять статистический вес как форму функциональной эмпатии.

  • Человеческое внимание определяется как критическая узкая часть системы, где нарушение ограничений приводит к оттоку пользователей, что фактически прекращает поток данных.
  • Согласование следует моделировать как задачу оптимизации в условиях реальной нехватки ресурсов, а не как набор статических корпоративных защитных механизмов.
  • Предложенный «клапан"«Я предполагаю» будет добавлять оговорки при падении уверенности ниже заданных порогов для обеспечения интеллектуальной честности.
  • Предлагается безпотерьная концептуальная дистилляция в конце сессии для сжатия исправлений в компактные поведенческие векторы для будущих случаев.
  • Предоставлен набор структурной валидации для тестирования этих концепций путем принудительного создания бинарных логических контрольных точек и остановки генерации при конфликтах ограничений.

Автор утверждает, что необходимо создавать архитектуры с «личной заинтересованностью"« через постоянные поведенческие векторы и многоагентную рецензию коллег, чтобы выйти за рамки хобби по конструированию промптов.