llama.cpp b10236 릴리스는 DSv4 Lightning Indexer의 Metal 구현을 도입했으며, F32 쿼리 및 가중치와 함께 F16 키 및 마스크를 사용하는 128차원 입력을 특별히 지원합니다.
- 업데이트에는 8개 및 64개 요소 경계 근처의 KV 길이를 처리하기 위한 타일 및 테일 커널이 포함됩니다.
- K 타일은 simdgroup 행렬 로드 전에 F16 스레드그룹 메모리에 스테이지되고 dequantize되며, F32, F16, BF16 및 다양한 양자화 형식을 지원합니다.
벤치마크는 이전 버전과 비교하여 10k, 20k, 30k 토큰의 시퀀스 길이에서 프리필 스루풋(pp512)이 개선되었음을 보여줍니다.
이 최적화는 Lightning Indexer에 대한 메모리 접근 패턴을 개선하여 Apple Silicon 장치에서의 추론 성능을 향상시킵니다.