llama.cpp b10858 릴리스는 인접한 UNARY 활성화(GELU, SIGMOID, SILU, SOFTPLUS)와 MUL 연산에 대한 Vulkan 커널 융합을 도입합니다. 이 최적화는 불필요한 메모리 접근과 런타임 분기를 제거함으로써 프롬프트 처리 속도의 10-18% 저하를 회복합니다.
- 융합 파이프라인은 f32 및 f16용 특수화된 SPIR-V 셰이더를 사용하여 GELU, SIGMOID, SILU 및 SOFTPLUS를 MUL과 함께 처리합니다.
- 그래프 최적화는 이제 VIEW나 RESHAPE와 같은 제로 연산 노드로 분리된 경우에도 융합된 쌍을 스케줄링하여 Gemma4와 같은 모델에서 발견되는 패턴에 대한 지원을 확장합니다.
- OP-on-B 융합 지원은 더 작은 MUL 피연산자에 활성화 기능을 허용하여 공유 전문가 아키텍처에서 효율적인 게이트팅을 가능하게 합니다.
- 백엔드 테스트는 다양한 텐서 모양 전반의 정확성을 검증하기 위해 'gate' 및 'view_mid'를 포함한 새로운 레이아웃을 다룹니다.
이 변경사항은 Vulkan 백엔드의 계산 오버헤드를 줄여 활성화 게이트팅 메커니즘에 크게 의존하는 모델의 추론 지연 시간을 상당히 개선합니다.