Le projet llama.cpp a publié la compilation b10069, qui comprend des mises à jour OpenCL spécifiques pour les GPU Qualcomm Adreno. Le changement principal implique la prise en charge des opérations de diffusion pour le noyau Adreno MUL_MAT et le respect des décalages de vue pour la variante Q8_0 MUL_MAT afin d'activer la fonctionnalité multi-stream dans llama-server.
- Ajout du support de diffusion pour les noyaux GEMM/GEMV noshuffle d'Adreno.
- Assuré que les décalages de vue sont correctement gérés pour les opérations GEMM/GEMV noshuffle d'Adreno.
- Implémenté le support général de diffusion GEMM/GEMV dans le backend OpenCL.
- Suppression des tests et commentaires inutiles de la base de code.
Cette mise à jour améliore la compatibilité avec les charges de travail multi-stream sur le matériel Adreno en corrigeant des problèmes critiques de gestion des noyaux.