El proyecto llama.cpp lanzó la compilación b10724, que mejora significativamente el rendimiento de la restauración de celdas KV cache no contiguas mediante lecturas scatter agrupadas por ejecución continua.

  • Restauración del estado optimizada para buffers circulares fragmentados precalculando los índices consecutivos de destino y utilizando copias únicas en lugar de copias individuales de celdas.
  • Se corrigió un fallo de aserción en el lector del dispositivo cuando las cuentas de tensores de guardado y restauración coincidían pero el chunking difería, recurriendo a una copia con cursor de bytes.
  • Se añadieron pruebas en el host y en el dispositivo que verifican la restauración del estado idéntica byte a byte para celdas de secuencia entrelazada.

Esta optimización reduce el número de copias de memoria requeridas para restauraciones grandes de más de 1.3 millones a solo 224, reduciendo el tiempo de restauración de decenas de segundos a menos de medio segundo.