Проект llama.cpp выпустил сборку b10715, которая включает ключевую оптимизацию реализации DFlash. Кодировщик DFlash теперь напрямую объединён с процессом инъекции в KV-кэш во время декодирования.

Ранее запуск кодировщика как отдельного вызова `llama_encode` требовал кругового перехода устройства на хост для его вывода перед тем, как инъекционное декодирование могло снова загрузить его, а также второго построения графа для каждого такого цикла. Это изменение встраивает кодировщик в ветвь эмбеддингов декодера, позволяя целевым признакам подаваться напрямую в единый вызов `llama_decode`.

Релиз предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.