El proyecto llama.cpp lanzó la compilación b10715, que incluye una optimización clave en la implementación de DFlash. El codificador DFlash ahora se fusiona directamente en el proceso de inyección del caché KV durante la decodificación.
Anteriormente, ejecutar el codificador como una llamada separada `llama_encode` forzaba un viaje de ida y vuelta del dispositivo al host para su salida antes de que la decodificación de inyección pudiera volver a cargarlo, junto con una segunda construcción de gráfico por ciclo. Este cambio integra el codificador en la rama de incrustaciones del decodificador, permitiendo que las características objetivo se alimenten directamente a una única llamada `llama_decode`.
El lanzamiento proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.