Una nueva propuesta describe una estructura de memoria LLM que combina el fragmentado tardío con aristas ponderadas por atención para permitir un recorrido paso a paso. El sistema aprovecha el modelo de incrustación de Jina AI, que calcula la atención entre oraciones, para derivar los pesos de las aristas del procesamiento interno del documento.
- El fragmentado tardío preserva el contexto a nivel de documento al tokenizar e incrustar todo el texto antes de derivar los vectores de los fragmentos.
- Las matrices de atención de un pase hacia adelante definen las aristas del gráfico, con pesos basados en cuánto un fragmento atendió a otro.
- La recuperación utiliza un recorrido en enjambre con un presupuesto decreciente, deteniéndose cuando los costos superan los límites en lugar de en recuentos de saltos fijos.
- Las actualizaciones de incrustación se ajustan por el presupuesto restante, asegurando que los nodos centrales cambien más que los distantes.
Este enfoque permite una gestión dinámica del contexto donde la relevancia de la información recuperada determina su influencia en el estado de la memoria.