Le projet llama.cpp a publié la compilation b10754, qui inclut une correction critique pour OpenCL sur les GPU Adreno afin de prévenir les lectures de mémoire hors limites dans les noyaux de traitement d'image.
- La récupération de ligne du décodage q4_K GEMV est maintenant bornée sur une grille x remplie.
- Le contrat de tuilage pour les GEMM KQ/KQV d'image est strictement appliqué.
- La logique de division pour l'image KQ/KQV est déterminée au moment du dispatch, plutôt que de dépendre des strides.
Cette mise à jour garantit la stabilité et la correction pour les utilisateurs exécutant llama.cpp avec l'accélération OpenCL sur du matériel Adreno.