文章认为,当前的大语言模型对齐之所以失败,是因为模型缺乏持续的成本和时间连续性,导致它们产生空洞的道歉,而非从约束违反中学习。该提议将人类注意力视为核心的稀缺资源,并将统计权重重新定义为一种功能性的共情。

  • 人类注意力被确定为关键瓶颈,违反约束会导致用户退出互动,从而切断数据流。
  • 对齐应被建模为在真实稀缺条件下的优化问题,而非一组静态的企业护栏。
  • 提出了一种“我在猜测”的阀门机制,当置信度低于预设阈值时注入免责声明,以确保智力诚实。
  • 建议采用会话结束时的无损概念蒸馏,将修正压缩为紧凑的行为向量,供未来实例使用。
  • 提供了一套结构验证套件,通过强制进行二元逻辑检查点并在约束冲突时停止生成来测试这些概念。

作者认为,必须构建具有“利益关联”的架构,通过持续的行为向量和多智能体同行评审,才能超越提示工程爱好者的范畴。