Новое предложение описывает структуру памяти LLM, которая объединяет позднее разбиение на фрагменты (late chunking) с рёбрами, взвешенными по вниманию, чтобы обеспечить пошаговый обход. Система использует модель встраивания от Jina AI, которая вычисляет внимание между предложениями, для получения весов рёбер из внутренней обработки документа.
- Позднее разбиение на фрагменты сохраняет контекст уровня документа, токенизируя и создавая встраивания всего текста перед получением векторов фрагментов.
- Матрицы внимания от прямого прохода определяют рёбра графа, с весами, основанными на том, насколько один фрагмент обращал внимание на другой.
- Поиск использует роение (swarming) обхода с убывающим бюджетом, останавливаясь, когда затраты превышают лимиты, а не при фиксированном количестве шагов.
- Обновления встраиваний корректируются оставшимся бюджетом, обеспечивая более значительные изменения центральных узлов по сравнению с удалёнными.
Этот подход позволяет динамическое управление контекстом, где релевантность полученной информации определяет её влияние на состояние памяти.