Новое предложение описывает структуру памяти LLM, которая объединяет позднее разбиение на фрагменты (late chunking) с рёбрами, взвешенными по вниманию, чтобы обеспечить пошаговый обход. Система использует модель встраивания от Jina AI, которая вычисляет внимание между предложениями, для получения весов рёбер из внутренней обработки документа.

  • Позднее разбиение на фрагменты сохраняет контекст уровня документа, токенизируя и создавая встраивания всего текста перед получением векторов фрагментов.
  • Матрицы внимания от прямого прохода определяют рёбра графа, с весами, основанными на том, насколько один фрагмент обращал внимание на другой.
  • Поиск использует роение (swarming) обхода с убывающим бюджетом, останавливаясь, когда затраты превышают лимиты, а не при фиксированном количестве шагов.
  • Обновления встраиваний корректируются оставшимся бюджетом, обеспечивая более значительные изменения центральных узлов по сравнению с удалёнными.

Этот подход позволяет динамическое управление контекстом, где релевантность полученной информации определяет её влияние на состояние памяти.