Uma nova proposta descreve uma estrutura de memória LLM que combina chunking tardio com arestas ponderadas por atenção para permitir travessia passo a passo. O sistema utiliza o modelo de embedding da Jina AI, que calcula a atenção entre sentenças, para derivar os pesos das arestas do processamento interno do documento.
- O chunking tardio preserva o contexto em nível de documento ao tokenizar e incorporar todo o texto antes de derivar os vetores dos chunks.
- As matrizes de atenção de uma passagem direta definem as arestas do gráfico, com pesos baseados em quanto um chunk atendeu a outro.
- A recuperação usa travessia em enxame com orçamento decrescente, parando quando os custos excedem os limites em vez de em contagens de saltos fixas.
- As atualizações de embedding são ajustadas pelo orçamento restante, garantindo que os nós centrais mudem mais do que os distantes.
Esta abordagem permite o gerenciamento dinâmico de contexto onde a relevância da informação recuperada determina sua influência no estado da memória.