El proyecto llama.cpp lanzó la compilación b10414, introduciendo soporte para el tipo de cuantización ternaria GGML_TYPE_TQ2_0 en el backend de Metal. Esta actualización también incluye optimizaciones al kernel mul_mv de tensores contiguos (cont).
- Añadido soporte para GGML_TYPE_TQ2_0 (ternario, 2 bits por elemento) en el backend de Metal.
- Optimizado el kernel mul_mv cambiando de operaciones enteras a operaciones de punto flotante.
- Mejorado el rendimiento mediante sumas precálculadas, coeficientes elevados y cargas contiguas de y.
Esta versión proporciona binarios actualizados para macOS, Linux, Windows, Android y openEuler en varios backends de hardware que incluyen CPU, CUDA, Vulkan, ROCm y SYCL.