O projeto llama.cpp lançou a versão b10669, que inclui uma otimização de desempenho para o caminho SDPA do oneDNN ao vincular o cache KV f16 no lugar.
- A alteração reduz o tráfego de memória durante os chunks de prefill; por exemplo, no Qwen3.8 27B com um comprimento KV ativo de 34816, ela reduz o tráfego por ubatch de 4.56 GB para menos, evitando cópias em etapas.
- Os binários estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
Esta atualização fornece aos usuários um desempenho de inferência otimizado em hardware suportado, mantendo a ampla compatibilidade com plataformas.