Le projet llama.cpp a publié la version b10246, qui inclut une correction pour les performances d'OpenCL sur des configurations de modèles spécifiques. La mise à jour résout un problème où la condition de dimension originale était insuffisante pour gérer de grands poids.
- Route les tenseurs lm_head q6_K grands vers GEMV plat au lieu de gemv_noshuffle.
- Ajoute une condition de taille directe pour éviter les ralentissements avec des modèles comme gemma-4 E2B, qui a des dimensions [1536, 262144].
- Fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) et openEuler.
Ce changement garantit que les grandes matrices de poids sont traitées efficacement sur les appareils OpenCL sans provoquer de goulots d'étranglement de performance.