O projeto llama.cpp lançou a compilação b10715, que inclui uma otimização-chave na implementação do DFlash. O codificador DFlash agora é fundido diretamente no processo de injeção do cache KV durante a decodificação.

Anteriormente, executar o codificador como uma chamada separada `llama_encode` forçava uma ida e volta do dispositivo para o host para sua saída antes que a decodificação de injeção pudesse reenviá-la, junto com uma segunda construção de grafo por rodada. Essa mudança incorpora o codificador no ramo de embeddings do decodificador, permitindo que recursos-alvo sejam alimentados diretamente em uma única chamada `llama_decode`.

O lançamento fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.