Le projet llama.cpp a publié la version b10726, qui introduit des optimisations de performance significatives pour traiter de grandes tailles de lots dans les modèles quantifiés IQ. La mise à jour principale exploite les instructions AVX2 pour accélérer les quants IQ de grille via des opérations GEMM par lot.
- Implémentation de GEMM par lot pour les quants IQ de grille
- Vectorisation du décodage des panneaux IQ avec un seuil abaissé pour l'accélération
- Introduction du noyau ggml_gemm_iqp_8x8_q8_K_p4 et suppression du tampon gather
- Disposition de gather à source unique, biais de porte et entrelacement vectorisé pour les panneaux IQ
- Ajout du support de repli NUMA et de tests de lots de 10 lignes pour la couverture IQP
Cette version offre des capacités d'inférence plus rapides aux utilisateurs exécutant des modèles IQ sur un matériel compatible.