Le projet llama.cpp a publié la version b10669, qui inclut une optimisation de performance pour le chemin SDPA de oneDNN en liant le cache KV f16 sur place.

  • Le changement réduit le trafic mémoire pendant les chunks de préremplissage ; par exemple, sur Qwen3.8 27B avec une longueur KV active de 34816, il diminue le trafic par ubatch de 4,56 Go à moins en évitant les copies échelonnées.
  • Les binaires sont disponibles pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.

Cette mise à jour offre aux utilisateurs des performances d'inférence optimisées sur le matériel pris en charge tout en maintenant une large compatibilité avec les plateformes.