llama.cpp b10306 릴리스는 게이트드 리니어 유닛(GLU) 연산을 대상으로 하는 SYCL 백엔드의 성능 최적화를 도입합니다. 이 업데이트는 융합된 GLU 연산에 대한 연속적인 고속 경로를 추가하고, 이전에 별개였던 커널을 통합하여 공통 런처를 공유하도록 합니다.
- f16 및 f32에서 512개와 2048개의 토큰을 가진 17408 열을 커버하는 SWIGLU 성능 테스트 케이스 추가.
- 연산을 인자로 받아 사용하지 않는 SYCL_GELU_BLOCK_SIZE 및 SYCL_SILU_BLOCK_SIZE 상수를 제거하며 융합 GLU 커널 통합.
- 디인터리브 인덱스 수학이 항등식으로 수렴되는 연속 피연산자에 대한 평탄 커널 디스패치 구현.
- Arc Pro B70에서 분할 GLU에 대해 f16에서는 +14%, f32에서는 +4% 성능 향상 달성, 융합 연산은 변경 없음.
이러한 변경 사항은 코드 중복을 줄이고 특정 텐서 구성에 대한 메모리 접근 패턴을 최적화하여 SYCL 백엔드의 효율성을 개선합니다.