La version llama.cpp b10089 étend les opérations CUDA GET_ROWS pour prendre en charge les formats de quantification k-quants, i-quants et mxfp4. Ce changement garantit que tous les types GGML quantifiés peuvent désormais emprunter le chemin direct du périphérique pour les recherches d'embedding.

  • Ajoute le support k-quant (q2_K à q6_K) pour gérer des recettes GGUF courantes comme Q4_K_M.
  • Étend les déquantiseurs super-bloc partagés à neuf i-quants avec une disposition de 32 threads.
  • Déplace le déquantiseur mxfp4 vers des assistants partagés, fermant la couverture des types GET_ROWS sur CUDA.
  • Limite les vérifications de taille de ligne uniquement aux types de sous-bloc de 32 valeurs (iq4_nl et mxfp4) pour éviter les retours inutiles à l'hôte.

En empêchant le planificateur de revenir à l'hôte pour ces types de quantification, la mise à jour évite de copier toute la matrice d'embedding à chaque token dans les graphiques à dispositif unique.