Proyek llama.cpp merilis build b10715, yang mencakup optimasi kunci pada implementasi DFlash. Encoder DFlash sekarang digabungkan langsung ke dalam proses injeksi cache KV selama decoding.

Sebelumnya, menjalankan encoder sebagai panggilan terpisah `llama_encode` memaksa perjalanan bolak-balik perangkat-ke-host untuk outputnya sebelum decoding injeksi dapat menguploadnya kembali, bersama dengan pembangunan grafik kedua per putaran. Perubahan ini melipat encoder ke dalam cabang embedding decoder, memungkinkan fitur target diberikan langsung ke satu panggilan `llama_decode`.

Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.