Le projet llama.cpp a publié la compilation b10715, qui inclut une optimisation clé de l'implémentation de DFlash. Le codeur DFlash est désormais fusionné directement dans le processus d'injection du cache KV lors du décodage.
Auparavant, l'exécution du codeur en tant qu'appel séparé `llama_encode` imposait un aller-retour appareil-hôte pour sa sortie avant que le décodage d'injection puisse le réimporter, ainsi qu'une deuxième construction de graphe par tour. Ce changement intègre le codeur dans la branche d'embedding du décodeur, permettant aux caractéristiques cibles d'être alimentées directement dans un seul appel `llama_decode`.
La version fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.