El proyecto llama.cpp lanzó la compilación b10534, que introduce puntos de conmutación específicos del hardware para ajustar el cruce entre las rutas de vector y núcleo tensor durante la descodificación cuantizada en CUDA.
- El lanzamiento añade configuración en tiempo de ejecución mediante GGML_CUDA_MMVQ_MAX para ajustar el umbral del tamaño del lote donde el kernel cambia de mul_mat_vec_q a MMQ.
- Se incluyen ahora valores específicos del punto de conmutación para las arquitecturas Blackwell, DGX Spark y Ada, reduciendo la dependencia de variables de entorno.
- Reducir este umbral dirige lotes más grandes hacia la ruta del núcleo tensor int8 MMQ, produciendo una aceleración medida del 23-41% con un tamaño de lote de 8 en RTX 5090 para modelos densos Q4_K.
- La actualización incluye binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.
Este cambio mejora el rendimiento de inferencia en GPUs NVIDIA modernas seleccionando automáticamente la ruta de kernel más eficiente según el tamaño del lote y las capacidades del hardware.