La version llama.cpp b10614 introduit un changement architectural significatif pour le backend Metal en divisant les sources des opérations et en activant la compilation parallèle. Cette mise à jour comprend également plusieurs nouvelles implémentations de noyaux et le support pour des formats de quantification supplémentaires.

  • Diviser metallib en 8 bibliothèques et les charger en parallèle pour améliorer les temps de build.
  • Ajouter l'opération col2im_1d prenant en charge les types de données f32, f16 et bf16.
  • Implémenter le support CONV_2D_DW (convolution profonde) pour Metal.
  • Ajouter le support du format de quantification Q2_0.
  • Fusionner les opérations d'activation snake (mul, sin, sqr, mul, add).
  • Introduire le noyau FWHT pour le backend Metal.

Cette version fournit des binaires précompilés pour macOS, iOS, Linux, Windows, Android et openEuler sur CPU, GPU et divers backends d'accélérateurs.