El proyecto llama.cpp ha lanzado la versión b10926, que incluye una corrección para manejar las cuantizaciones tq1_0 no compatibles fallando de forma elegante. Esta actualización aborda el problema #28681 para mejorar la estabilidad al encontrar este formato de cuantización específico.

La versión proporciona binarios para macOS (Apple Silicon e Intel), Linux (Ubuntu con backends de CPU, Vulkan, ROCm 10.0, OpenVINO y SYCL), Android (arm64), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL y ROCm 10.0) y arquitecturas openEuler.

Esta actualización asegura que los usuarios puedan seguir utilizando llama.cpp sin interrupciones cuando los modelos utilicen el esquema de cuantización tq1_0.