llama.cpp b11372 릴리스는 긴 컨텍스트 처리 중 인덱서 점수에 필요한 메모리를 주로 절반으로 줄이는 qwen4exp 모델의 라이트닝 인덱서에 대한 최적화를 도입합니다. 이는 각 헤드에 대해 별도의 텐서를 생성하는 대신 헤드 점수를 제자리에서 계산함으로써 달성됩니다.
- qwen4exp 인덱서는 이제 할당자 버퍼를 재사용하고 ggml_lightning_indexer를 통해 점수를 계산하여 피크 메모리 사용량을 줄입니다.
- 4개의 헤드를 위한 라이트닝 인덱서에 대한 CUDA 백엔드 지원이 추가되어 벡터 커널로 디스패치됩니다.
- Metal 백엔드가 함수 상수에서 헤드 수를 읽도록 업데이트되어 코드 변경 없이 모든 헤드 수를 실행할 수 있습니다.
- Vulkan 백엔드는 공유 메모리와 fp16 곱셈을 사용하여 키와 토큰에 걸쳐 라이트닝 인덱서를 타일링합니다.
이러한 변경 사항은 계산 버퍼 크기와 속도를 유지하면서 긴 컨텍스트가 있는 qwen4exp 모델의 메모리 효율성을 향상시킵니다.