llama.cpp 프로젝트는 SYCL 백엔드에서 SSM_CONV 창 로드를 결합하는 성능 최적화를 포함한 빌드 b10322를 출시했습니다.
- Arc Pro B70에서 인터리브된 A/B 테스트는 특정 텐서 모양에 대해 1.85x에서 1.87x의 속도 향상을 보였으며, n_t=1일 때는 무시할 수 있는 변화만 있었습니다.
- 64개 블록 중 48개에서 ssm_conv를 실행하는 Qwen35 27B Q4_K - Medium 모델에 대한 벤치마크는 프롬프트 처리 시간의 +2.2% 개선을 나타냈습니다.
- 이 릴리스는 macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) 및 openEuler에 대한 바이너리를 제공합니다.
이 업데이트는 호환되는 하드웨어에서 SSM_CONV 연산을 사용하는 워크로드의 추론 처리량을 향상시킵니다.