llama.cpp b10208 릴리스는 oneMKL GEMM 플래시 어텐션에 대한 SYCL 지원을 도입하여 프롬프트 처리를 위한 XMX 하드웨어 가속을 가능하게 합니다. 이 변경은 기본 TILE 경로 대신 MKL 커널을 활용하여 Intel Arc GPU에서의 추론 속도를 크게 향상시킵니다.
- 성능 벤치마크는 B70/Battlemage 하드웨어에서 Gemma-4-26B(1473 t/s 대 746 t/s)에 대해 1.97배, Qwen3.6-27B(609 t/s 대 330 t/s)에 대해 1.85배의 속도 향상을 보여줍니다.
- 이 구현은 이전에는 대부분의 모델에서 어텐션 출력을 손상시켰던 normalize 커널의 인터리브된 대상 레이아웃 버그를 수정합니다.
- MKL 플래시 어텐션이 이제 모든 KV 캐시 유형(F16, BF16, F32 및 양자화된)에 대해 활성화되어 이전에는 양자화된 캐시에만 제한되었던 제약이 제거되었습니다.
- 새로운 환경 변수를 통해 사용자는 GGML_SYCL_ENABLE_MKL_FA를 통해 디버깅을 활성화하거나 기능을 비활성화하거나 활성화 임계값을 제어할 수 있습니다.
이 업데이트는 호환되는 Intel 하드웨어에서 다중 토큰 프리필프 작업에 대한 상당한 지연 시간 감소를 제공하면서 표준 구현과 동일한 퍼플렉시티를 유지합니다.