llama.cpp b11224 릴리스는 KV 캐시와 같은 더 크고 스트라이드 있는 텐서의 슬라이스를 읽을 때 Vulkan 백엔드에서 행렬 곱셈 연산이 잘못된 계산 결과를 생성하는 문제를 해결합니다.

  • in-place src0 및 src1 텐서의 배치 스트라이드는 이제 ne00*ne01 대신 nb[2]에서 올바르게 유도되어 모든 헤드 across 행 접근이 적절하게 보장됩니다.
  • ggml_nbytes 또는 ggml_vk_subbuffer를 사용하여 strided extent에 따라 in-place A 및 B 범위가 크기 조정되어 coopmat2 없이 NVIDIA 하드웨어에서 지워진 데이터를 읽거나 멈추는 것을 방지합니다.
  • mul_mat_id 및 mul_mm 경로가 업데이트되어 스트라이드 있는 전문가 뷰와 부분 타일을 올바르게 처리하고 NVFP4 연산에서의 멈춤을 피합니다.

이 수정은 Vulkan 백엔드의 스트라이드 있는 메모리 레이아웃에 의존하는 디코더 셀프 어텐션 메커니즘의 정확한 추론 결과를 보장합니다.