本記事は、現在のLLMの整列が失敗している理由として、モデルが一貫したコストと時間的連続性を欠いているため、制約違反から学ぶのではなく空虚な謝罪を生み出すと主張する。そして、人間の注意を主要な希少資源として扱い、統計的重みを機能的共感の一形態として再定義することを提案する。

  • 人間の注意が重要なボトルネックとして特定され、制約の違反はユーザーの離脱を引き起こし、結果としてデータストリームを実質的に停止させる。
  • 整列は、静的な企業のガードレールの集合ではなく、現実の希少性に基づく最適化問題としてモデル化するべきである。
  • 信頼度が設定された閾値を下回った際に免責事項を挿入する提案された「推測しています」バルブにより、知的誠実性を確保する。
  • セッション終了時の損失のない概念的蒸留が提案され、修正を将来のインスタンスのためにコンパクトな行動ベクトルに圧縮する。
  • これらの概念を検証するために、バイナリ論理チェックポイントを強制し、制約の競合時に生成を停止させる構造的検証スイートが提供される。

著者は、一貫した行動ベクトルとマルチエージェントによるピアレビューを通じて「実益」のあるアーキテクチャを構築することが、プロンプトエンジニアリングの趣味を超えて進むために必要であると主張する。