一项新提案概述了一种 LLM 内存结构,它将后期分块与注意力加权边相结合,以实现逐步遍历。该系统利用 Jina AI 的嵌入模型,该模型计算句子之间的注意力,从而从文档的内部处理中推导出边的权重。

  • 后期分块通过对整个文本进行标记化和嵌入,在推导分块向量之前保留文档级上下文。
  • 前向传播产生的注意力矩阵定义图的边,其权重基于一个分块对另一个分块的关注程度。
  • 检索使用带有衰减预算的群体遍历,当成本超过限制时停止,而不是在固定的跳数时停止。
  • 嵌入更新由剩余预算微调,确保中心节点的变化比远端节点更大。

这种方法允许动态上下文管理,其中检索信息的相关性决定了其对内存状态的影响。