llama.cpp 项目发布了构建版本 b10715,其中包含对 DFlash 实现的一项关键优化。DFlash 编码器现在在解码期间直接融合到 KV 缓存注入过程中。

此前,将编码器作为单独的 `llama_encode` 调用运行会强制其输出进行设备到主机的往返传输,然后注入式解码才能重新上传它,并且每轮都需要构建一次图。此更改将编码器折叠到解码器的嵌入分支中,允许目标特征直接馈送到单个 `llama_decode` 调用。

该版本提供了适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)和 openEuler 的二进制文件。