Le projet llama.cpp a publié la version b11207, qui introduit le support des opérations GET_ROWS en tuiles Q4_0 et Q8_0 sur le backend Hexagon. Cette mise à jour comprend également des correctifs pour les macros, les débordements de registres et le pipeline DMA, ainsi que des améliorations de la logique de sélection des noyaux et la réactivation de la vectorisation.

  • Ajout du support des GET_ROWS en tuiles Q4_0 et Q8_0 pour Hexagon en utilisant la déquantification HVX en tuiles.
  • Correction des macros et des débordements de registres dans hex-get-rows lors du nettoyage des vérifications des opérations non prises en charge.
  • Amélioration du pipeline DMA et simplification de la logique de sélection des noyaux.
  • Réactivation du vectoriseur après qu'une régression a été identifiée lors d'une mise à jour du sampler.

La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur divers backends matériels incluant CPU, GPU, NPU, CUDA, ROCm, Vulkan, OpenVINO et SYCL.