Proyek llama.cpp merilis build b10322, yang mencakup optimasi kinerja yang menggabungkan beban jendela SSM_CONV di backend SYCL.
- Pada Arc Pro B70, tes A/B yang diselingi menunjukkan percepatan 1.85x hingga 1.87x untuk bentuk tensor tertentu, dengan perubahan yang dapat diabaikan untuk n_t=1.
- Benchmark pada model Qwen35 27B Q4_K - Medium yang menjalankan ssm_conv di 48 dari 64 blok menunjukkan peningkatan +2.2% dalam waktu pemrosesan prompt.
- Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP), dan openEuler.
Pembaruan ini meningkatkan throughput inferensi untuk beban kerja yang memanfaatkan operasi SSM_CONV pada perangkat keras yang kompatibel.