Le projet llama.cpp a publié la compilation b10069, qui comprend des mises à jour OpenCL spécifiques pour les GPU Qualcomm Adreno. Le changement principal implique la prise en charge des opérations de diffusion pour le noyau Adreno MUL_MAT et le respect des décalages de vue pour la variante Q8_0 MUL_MAT afin d'activer la fonctionnalité multi-stream dans llama-server.

  • Ajout du support de diffusion pour les noyaux GEMM/GEMV noshuffle d'Adreno.
  • Assuré que les décalages de vue sont correctement gérés pour les opérations GEMM/GEMV noshuffle d'Adreno.
  • Implémenté le support général de diffusion GEMM/GEMV dans le backend OpenCL.
  • Suppression des tests et commentaires inutiles de la base de code.

Cette mise à jour améliore la compatibilité avec les charges de travail multi-stream sur le matériel Adreno en corrigeant des problèmes critiques de gestion des noyaux.