llama.cpp 프로젝트는 DFlash 구현에 대한 주요 최적화를 포함하는 빌드 b10715를 출시했습니다. 이제 DFlash 인코더는 디코딩 중 KV 캐시 주입 프로세스에 직접 융합됩니다.

이전에는 인코더를 별도의 `llama_encode` 호출로 실행하면 그 출력에 대해 장치에서 호스트로의 왕복이 강제되었고, 주입 디코드가 이를 다시 업로드해야 했으며, 라운드마다 두 번째 그래프 빌드가 필요했습니다. 이 변경으로 인코더가 디코더의 임베딩 분기에 통합되어 대상 특징을 단일 `llama_decode` 호출에 직접 피드할 수 있게 되었습니다.

이 릴리스는 macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) 및 openEuler에 대한 바이너리를 제공합니다.