Le projet llama.cpp a publié la version b10791, introduisant des optimisations OpenCL significatives pour les têtes de modèles de langage quantifiées et les opérations GEMV de décodage. Cette mise à jour inclut également des améliorations du GEMM par lots moyens pertinentes pour le décodage spéculatif et la prédiction multi-jeton.
- Optimise le GEMV de décodage/lm_head quantifié opencl et le GEMM par lots moyens pour le décodage spéculatif/MTP.
- Protège l'enregistrement du noyau de conversion tiled_ns q4_K/q6_K pour les builds non-Adreno.
- Restreint la dispatch de fusion MUL_MAT+GLU q4_K spécifiquement au matériel Adreno.
- Nécessite la disposition des poids noshuffle dans la porte de fusion GLU q4_K.
- Empêche d'emprunter le chemin GEMV mrow f16 vectorisé sur des pas de ligne non alignés.
- Active le GEMV de décodage split-K q4_K uniquement là où les gains de performance sont mesurés.
- Restreint les valeurs par défaut du GEMV lm_head/embed tiled aux architectures X2E/A8X.
La publication fournit des binaires pour macOS, iOS, Linux, Windows, Android et openEuler sur CPU, GPU et divers backends d'accélérateurs.