Le projet llama.cpp a publié la version b10830, introduisant une nouvelle option de ligne de commande pour la conversion de modèles. Cette mise à jour ajoute le drapeau `--fuse-qkv`, qui permet aux utilisateurs de fusionner les matrices Query, Key et Value en une seule structure QKV lors de la conversion du format Hugging Face vers GGUF.

  • La release inclut des binaires pour macOS (Apple Silicon et Intel), Linux (Ubuntu avec les backends CPU, Vulkan, ROCm, OpenVINO et SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO et SYCL) et openEuler.
  • Le support iOS est fourni via un XCFramework, tandis que le support de KleidiAI sur macOS Apple Silicon est actuellement désactivé.

Cette mise à jour offre aux utilisateurs un chemin de conversion plus efficace pour les modèles qui bénéficient de mécanismes d'attention fusionnés.