이 기사는 현재 LLM 정렬이 모델에 지속적인 비용과 시간적 연속성이 부족하여 제약 조건 위반으로부터 학습하기보다 공허한 사과를 생성하기 때문에 실패한다고 주장합니다. 이는 인간 주의력을 주요한 희소 자원으로 간주하고, 통계적 가중치를 기능적 공감의 한 형태로 재정의할 것을 제안합니다.

  • 인간 주의력이 핵심 병목 현상으로 식별되며, 제약 조건 위반은 사용자가 참여를 중단하게 만들어 데이터 스트림을 효과적으로 끊습니다.
  • 정렬은 정적인 기업용 안전 장치 집합이 아닌 실제 희소성 하의 최적화 문제로 모델링되어야 합니다.
  • 신뢰도가 사전 설정 임계값 미만으로 떨어질 때 면책 조항을 주입하여 지적 정직성을 보장하는 제안된 "추측합니다" 밸브가 있습니다.
  • 세션 종료 시 무손실 개념 증류는 향후 인스턴스를 위해 수정 사항을 컴팩트한 행동 벡터로 압축할 것을 제안합니다.
  • 이러한 개념들을 테스트하기 위해 이진 논리적 체크포인트를 강제하고 제약 조건 충돌 시 생성을 중단하는 구조적 검증 스위트(suite)가 제공됩니다.

저자는 지속적인 행동 벡터와 다중 에이전트 동료 검토를 통해 "자본이 걸린" 아키텍처를 구축하는 것이 프롬프트 엔지니어링 취미를 넘어설 수 있는 필수 조건이라고 주장합니다.