La versión b11372 de llama.cpp introduce optimizaciones para el índice ligero (lightning indexer) del modelo qwen4exp, principalmente reduciendo a la mitad la memoria requerida para las puntuaciones del índice durante el procesamiento de contextos largos. Esto se logra calculando las puntuaciones de las cabezas in situ en lugar de materializar tensores separados para cada cabeza.
- El índice qwen4exp ahora reutiliza los búferes del asignador y calcula las puntuaciones mediante ggml_lightning_indexer para reducir el uso máximo de memoria.
- Se ha añadido soporte para el backend CUDA del índice ligero con 4 cabezas, distribuyéndolas al kernel vectorial.
- El backend Metal se ha actualizado para leer el número de cabezas desde una constante de función, permitiendo ejecutar cualquier número de cabezas sin cambios en el código.
- El backend Vulkan fragmenta el índice ligero sobre las claves y los tokens utilizando memoria compartida y productos punto fp16.
Estos cambios mejoran la eficiencia de memoria para los modelos qwen4exp con contextos largos mientras mantienen el tamaño del búfer de cómputo y la velocidad.