Le projet llama.cpp a publié la version 0.2.0, qui inclut une synchronisation avec la bibliothèque ggml mise à jour vers la version 0.21.0. Cette mise à jour introduit plusieurs améliorations des backends et de nouvelles fonctionnalités sur diverses plateformes matérielles.
- Ajout du support du noyau Kleidiai SME2 F32 GEMV pour des performances améliorées sur le matériel compatible.
- Activation de la fonctionnalité de fractionnement des tenseurs pour les modèles LFM2 et LFM2MOE afin d'améliorer la distribution multi-GPU.
- Mise en œuvre du support DSpark pour les modèles LFM2 au sein du pipeline de chargement des modèles.
- Mise à jour du backend SYCL avec MMVQ Q2_K réordonné, noyaux ESIMD, et corrections pour les GPU Alchemist et les problèmes de mlock.
- Amélioration de la stabilité d'OpenCL avec des correctifs pour les compilateurs Adreno A6x/A7x et les calculs de taille locale.
- Ajout de l'argument --mmproj-device à mtmd pour spécifier l'emplacement du dispositif des projections multimodales.
La sortie inclut également des nettoyages CI, des améliorations de la navigation dans les paramètres de l'interface utilisateur, et divers correctifs de bugs pour les backends CUDA, Metal et Vulkan.