Le projet llama.cpp a publié la version b11284, qui inclut une correction pour le backend OpenVINO afin de gérer correctement les opérations GET_ROWS sur les vues de poids quantifiés.
- La mise à jour résout view_src lors de la collecte des constantes de poids, empêchant les vues sur les poids quantifiés de devenir des paramètres dynamiquement typés.
- Le décalage de ligne de la vue est désormais intégré dans les indices de regroupement au lieu de découper le sous-graphe de déquantification.
- Ce changement lève le rejet des vues src0 quantifiées avec des décalages non nuls, permettant leur fonctionnement avec OpenVINO.
La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, GPU (CUDA, Vulkan, ROCm, SYCL) et NPU.