O projeto llama.cpp lançou a versão b10926, que inclui uma correção para lidar com quantizações tq1_0 não suportadas falhando de forma elegante. Esta atualização resolve o problema #28681 para melhorar a estabilidade ao encontrar este formato de quantização específico.
O lançamento fornece binários para macOS (Apple Silicon e Intel), Linux (Ubuntu com backends CPU, Vulkan, ROCm 10.0, OpenVINO e SYCL), Android (arm64), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm 10.0) e arquiteturas openEuler.
Esta atualização garante que os usuários possam continuar usando o llama.cpp sem travamentos quando os modelos utilizam o esquema de quantização tq1_0.