Une nouvelle proposition décrit une structure de mémoire LLM qui combine le fractionnement tardif avec des arêtes pondérées par l'attention pour permettre une traversée étape par étape. Le système exploite le modèle d'embedding de Jina AI, qui calcule l'attention entre les phrases, pour dériver les poids des arêtes du traitement interne du document.
- Le fractionnement tardif préserve le contexte au niveau du document en tokenisant et intégrant tout le texte avant de dériver les vecteurs des chunks.
- Les matrices d'attention d'un passage avant définissent les arêtes du graphe, avec des poids basés sur la mesure dans laquelle un chunk a prêté attention à un autre.
- La récupération utilise une traversée en essaim avec un budget décroissant, s'arrêtant lorsque les coûts dépassent les limites plutôt qu'à des comptes de sauts fixes.
- Les mises à jour d'embedding sont ajustées par le budget restant, garantissant que les nœuds centraux changent plus que les distants.
Cette approche permet une gestion dynamique du contexte où la pertinence de l'information récupérée détermine son influence sur l'état de la mémoire.