El proyecto llama.cpp ha lanzado la versión b10425, que incluye un puerto de la optimización SYCL para fusionar la copia de escritura de estado gated-delta-net.
- El cambio mejora el rendimiento aproximadamente un 1,2% en hardware Arc Pro B70 al ejecutar Qwen 3.6 27B con pasadas A/B entrelazadas.
- La latencia de prellenado (pp2048) se mantiene estable, mientras que la velocidad de generación de tokens aumenta ligeramente.
- Los binarios están disponibles para macOS, Linux, Windows, Android y openEuler en los backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.
Esta versión proporciona compilaciones actualizadas para varias plataformas y aceleradores para apoyar las últimas optimizaciones de modelos.