Le projet llama.cpp a publié la compilation b10414, introduisant le support du type de quantification ternaire GGML_TYPE_TQ2_0 dans le backend Metal. Cette mise à jour inclut également des optimisations pour le noyau mul_mv de tenseurs contigus (cont).

  • Ajout du support GGML_TYPE_TQ2_0 (ternaire, 2 bits par élément) au backend Metal.
  • Optimisation du noyau mul_mv en passant d'opérations entières à des opérations en virgule flottante.
  • Amélioration des performances grâce aux sommes précalculées, aux coefficients déplacés et aux chargements contigus de y.

Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et openEuler sur divers backends matériels incluant CPU, CUDA, Vulkan, ROCm et SYCL.