Rilis llama.cpp b10171 mengatasi bug kritis pada kernel gambar Adreno KQ/KQV yang menyebabkan output sampah selama batch multi-sekuens. Masalah ini muncul karena kernel-kernel tersebut mengabaikan dimensi 3, sehingga menyebabkan pembacaan yang salah saat menggunakan cache KV terpadu dengan beberapa stream.
- Mengarahkan tensor dengan ne03/ne13 > 1 ke jalur umum yang menangani dim 3 dengan benar.
- Menghormati view_offs saat membuat sub-buffer untuk mencegah pembacaan salah yang tidak terlihat.
- Memperbaiki skor perplexity pada perangkat Adreno 740 dan 840, mengurangi PPL dari ~1940 menjadi ~15.6 untuk Llama-3.2-1B-Instruct Q4_0.
- Menyertakan biner untuk macOS, iOS, Linux, Android, Windows, dan openEuler di seluruh CPU, GPU, dan backend khusus.
Perbaikan ini memastikan hasil inferensi yang benar pada perangkat Adreno di mana Flash Attention dinonaktifkan atau tidak tersedia, mencegah penurunan kinerja dalam konfigurasi server multi-slot.