Проект llama.cpp выпустил версию b10669, которая включает оптимизацию производительности для пути SDPA oneDNN за счёт привязки KV-кэша f16 на месте.
- Изменение снижает трафик памяти во время чанков префилла; например, на Qwen3.8 27B с живой длиной KV 34816 оно уменьшает трафик на ubatch с 4.56 GB до меньшего значения за счёт избегания поэтапных копирований.
- Бинарные файлы доступны для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.
Это обновление предоставляет пользователям оптимизированную производительность вывода на поддерживаемом оборудовании при сохранении широкой совместимости платформ.