Le projet llama.cpp a publié la compilation b10414, introduisant le support du type de quantification ternaire GGML_TYPE_TQ2_0 dans le backend Metal. Cette mise à jour inclut également des optimisations pour le noyau mul_mv de tenseurs contigus (cont).
- Ajout du support GGML_TYPE_TQ2_0 (ternaire, 2 bits par élément) au backend Metal.
- Optimisation du noyau mul_mv en passant d'opérations entières à des opérations en virgule flottante.
- Amélioration des performances grâce aux sommes précalculées, aux coefficients déplacés et aux chargements contigus de y.
Cette version fournit des binaires mis à jour pour macOS, Linux, Windows, Android et openEuler sur divers backends matériels incluant CPU, CUDA, Vulkan, ROCm et SYCL.