新しい提案は、ステップバイステップのトラバーサルを可能にするために、後期チャンキングと注意重み付きエッジを組み合わせた LLM メモリ構造を概説しています。このシステムは、文間の注意を計算する Jina AI の埋め込みモデルを活用し、ドキュメントの内部処理からエッジの重みを導出します。
- 後期チャンキングは、チャンクベクトルを導出する前に全文をトークン化して埋め込むことで、ドキュメントレベルのコンテキストを保持します。
- フォワードパスからの注意行列がグラフのエッジを定義し、重みは1つのチャンクが別のチャンクにどれほど注意を向けたかに基づきます。
- 検索は減衰する予算を持つスワーミングトラバーサルを使用し、固定ホップ数ではなくコストが制限を超えたときに停止します。
- 埋め込みの更新は残りの予算によって微調整され、中心ノードが遠隔ノードよりも多く変化するように保証されます。
このアプローチにより、取得された情報の関連性がメモリ状態への影響を決定する動的なコンテキスト管理が可能になります。