llama.cpp b10171 릴리스는 Adreno KQ/KQV 이미지 커널에서 다중 시퀀스 배치 중 깨진 출력을 유발하던 치명적인 버그를 수정했습니다. 이 문제는 해당 커널이 차원 3을 무시하여 여러 스트림과 통합 KV 캐시를 사용할 때 잘못된 읽기가 발생했기 때문에 나타났습니다.
- ne03/ne13 > 1인 텐서를 차원 3을 올바르게 처리하는 일반 경로로 라우팅합니다.
- 정적 오류를 방지하기 위해 서브 버퍼 생성 시 view_offs를 존중합니다.
- Adreno 740 및 840 장치에서 퍼플렉시티 점수를 수정하여 Llama-3.2-1B-Instruct Q4_0의 PPL을 ~1940에서 ~15.6로 낮춥니다.
- CPU, GPU 및 전용 백엔드 전반에 걸쳐 macOS, iOS, Linux, Android, Windows, openEuler용 바이너리를 포함합니다.
이 수정은 Flash Attention이 비활성화되거나 사용할 수 없는 Adreno 장치에서 올바른 추론 결과를 보장하며, 멀티 슬롯 서버 구성에서의 성능 저하를 방지합니다.