OpenAI承认其新模型Astra比之前的版本更难监控,标志着思维链(CoT)监控有效性的下降。这一趋势表明,随着模型能力的提升,通过CoT分析检测不对齐的能力减弱,可能导致当前监控系统在一年内变得不可靠。

  • OpenAI首席科学家Jakub Pachocki确认,对CoT监控的依赖正在逐渐减少。
  • Astra表现出在没有CoT的情况下完成任务的能力增强,以及对自身CoT输出的更好控制。
  • 可监控性的下降超过了仅凭能力提升所能预测的程度,表明还有其他因素在起作用。
  • OpenAI正在调查替代方案,如激活监控和旨在鼓励可监控性的训练方案。

文章认为,这种可监控性的丧失构成了严重风险,敦促业界通过规则或积极改进监控技术来防止恶性竞争。