O projeto llama.cpp lançou a versão b10425, que inclui uma porta da otimização SYCL para fundir a cópia de gravação de estado gated-delta-net.
- A alteração melhora o desempenho em aproximadamente 1,2% no hardware Arc Pro B70 ao executar Qwen 3.6 27B com passagens A/B intercaladas.
- A latência de pré-preenchimento (pp2048) permanece estável, enquanto a velocidade de geração de tokens aumenta ligeiramente.
- Os binários estão disponíveis para macOS, Linux, Windows, Android e openEuler nos backends CPU, CUDA, Vulkan, ROCm, OpenVINO e SYCL.
Este lançamento fornece builds atualizados para várias plataformas e aceleradores para suportar as últimas otimizações de modelos.