O projeto llama.cpp lançou a compilação b10322, que inclui uma otimização de desempenho que coalesce os carregamentos de janela SSM_CONV no backend SYCL.
- Em um Arc Pro B70, testes A/B intercalados mostraram uma aceleração de 1.85x a 1.87x para formas de tensor específicas, com mudança desprezível para n_t=1.
- Benchmarks em modelos Qwen35 27B Q4_K - Medium executando ssm_conv em 48 dos 64 blocos indicaram uma melhoria de +2.2% no tempo de processamento do prompt.
- O lançamento fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) e openEuler.
Esta atualização melhora a taxa de inferência para cargas de trabalho que utilizam operações SSM_CONV em hardware compatível.