Proyek llama.cpp merilis build b11043, yang mencakup perubahan pada implementasi flash-attention HMX. Pembaruan ini mengaktifkan dukungan untuk dimensi kepala yang bukan kelipatan 64, secara khusus memungkinkan konfigurasi seperti head_dim=72 dari SigLIP.
- Kernel flash-attention HMX sekarang beroperasi dengan DK/DV dibulatkan ke atas menjadi 64 dengan lane ekor diisi nol.
- Binari pra-dibangun tersedia untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android, dan openEuler.
Perubahan ini memungkinkan pengguna menjalankan model dengan dimensi kepala non-standar pada perangkat keras yang didukung tanpa masalah kompatibilitas.