El proyecto llama.cpp lanzó la versión b10840, que introduce optimizaciones de rendimiento para inferencia en CUDA. La actualización implementa cómputo sin ramificación para los formatos de cuantización Q4_K y Q5_K para acelerar la multiplicación matriz-vector (mmvq).
- El desempaquetado sin ramificación evita la reejecución de la escala para cada columna en mmvq, mejorando el rendimiento con tamaños de lote mayores a 1.
- La lógica de prefetch L2 está condicionada específicamente para hardware DGX Spark para asegurar que se logren las ganancias.
- El guardián de prefetch L2 de mmvq se extiende para soportar los backends MUSA y HIP junto con CUDA.
- Los puntos de cambio para Q4_K se actualizan para acomodar un rango más amplio de modelos.
Estos cambios proporcionan mejoras de rendimiento medibles para usuarios que ejecutan llama.cpp en sistemas DGX Spark con tamaños de lote superiores a uno.