La versión llama.cpp b10089 extiende las operaciones CUDA GET_ROWS para dar formato a los formatos de cuantización k-quants, i-quants y mxfp4. Este cambio asegura que todos los tipos GGML cuantizados ahora pueden tomar la ruta directa del dispositivo para búsquedas de incrustaciones.
- Añade soporte k-quant (q2_K a q6_K) para manejar recetas GGUF comunes como Q4_K_M.
- Extiende desquantizadores super-bloque compartidos a nueve i-quants con una disposición de 32 hilos.
- Mueve el desquantizador mxfp4 a ayudantes compartidos, cerrando la cobertura de tipos GET_ROWS en CUDA.
- Controla las comprobaciones de tamaño de fila solo para tipos de sub-bloque de 32 valores (iq4_nl y mxfp4) para evitar retrocesos innecesarios del host.
Al evitar que el programador retroceda al host para estos tipos de cuantización, la actualización evita copiar toda la matriz de incrustaciones de nuevo en cada token en gráficos de un solo dispositivo.