Le projet llama.cpp a publié la version b10926, qui inclut une correction pour gérer les quantifications tq1_0 non prises en charge en échouant de manière gracieuse. Cette mise à jour résout le problème #28681 afin d'améliorer la stabilité lors de la rencontre avec ce format de quantification spécifique.
La version fournit des binaires pour macOS (Apple Silicon et Intel), Linux (Ubuntu avec les backends CPU, Vulkan, ROCm 10.0, OpenVINO et SYCL), Android (arm64), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm 10.0) et les architectures openEuler.
Cette mise à jour garantit que les utilisateurs peuvent continuer à utiliser llama.cpp sans plantages lorsque les modèles utilisent le schéma de quantification tq1_0.