Le projet llama.cpp a publié la version b11195, introduisant une implémentation de multiplication matricielle en tuiles pour les k-quants dans le backend CPU. Ce changement décompacte les données quantifiées en tuiles int8 de 256x256 et calcule les résultats à l'aide de micro-noyaux afin d'améliorer les performances sur les grandes opérations matricielles.

  • mul_mat en tuiles offre un gain de vitesse de 3 à 6x pour les grandes multiplications matricielles, avec un point d'équilibre aux dimensions 4096x64 * 64x4096.
  • Les taux d'erreur restent négligeables, avec des erreurs maximales autour de 1-e04 et une RMSE autour de 1-e05.
  • La version inclut des correctifs pour les builds ARM et Windows, un support unifié d'IQP pour les benchmarks Q5_K et IQ4_XS, ainsi que des noyaux AVX2 optimisés.

La mise à jour améliore la vitesse d'inférence pour les grandes opérations matricielles tout en maintenant la précision numérique sur les plateformes prises en charge.