Rilis llama.cpp b11463 menyertakan pembaruan SYCL yang mengaktifkan MKL flash attention untuk bentuk Multi-Latent Attention (MLA) spesifik dari GLM-4.7 Flash, yang sebelumnya ditolak oleh dispatcher.

  • Perubahan ini mengakui bentuk 576/576/512 GQA-20 F16 ke dalam pipeline MKL dan menangani V cache sebagai tampilan strided dari baris K.
  • Sebuah upaya untuk menyimpan skor MKL flash attention dalam F16 guna mengurangi lalu lintas memori disertakan, tetapi kemudian dibatalkan dalam build ini.
  • Pada Intel Arc Pro B70, optimasi MLA meningkatkan pemrosesan prompt (pp8192) dari 432.80 menjadi 1292.29 tok/s, percepatan sebesar 2.99x.
  • Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di backend CPU, CUDA, ROCm, Vulkan, OpenVINO, dan SYCL.