llama.cpp b11463 릴리스에는 이전에 디스패처에 의해 거부되었던 GLM-4.7 Flash의 특정 Multi-Latent Attention (MLA) 형태에 대해 MKL flash attention을 활성화하는 SYCL 업데이트가 포함되어 있습니다.
- 이 변경으로 576/576/512 GQA-20 F16 형태가 MKL 파이프라인에 허용되며, V cache는 K 행의 스트라이드 뷰로 처리됩니다.
- 메모리 트래픽을 줄이기 위해 MKL flash attention 점수를 F16으로 저장하려는 시도가 포함되었으나, 이 빌드에서 나중에 되돌려졌습니다.
- Intel Arc Pro B70에서 MLA 최적화는 프롬프트 처리(pp8192)를 432.80에서 1292.29 tok/s로 개선하여 2.99배의 속도 향상을 달성했습니다.
- 이 릴리스는 CPU, CUDA, ROCm, Vulkan, OpenVINO 및 SYCL 백엔드를 위한 macOS, Linux, Windows, Android 및 openEuler용 바이너리를 제공합니다.