El proyecto llama.cpp lanzó la versión b10246, que incluye una corrección para el rendimiento de OpenCL en configuraciones específicas de modelos. La actualización aborda un problema donde la condición de dimensión original era insuficiente para manejar grandes pesos.
- Enruta tensores lm_head q6_K grandes a GEMV plano en lugar de gemv_noshuffle.
- Añade una condición de tamaño directa para evitar ralentizaciones con modelos como gemma-4 E2B, que tiene dimensiones [1536, 262144].
- Proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) y openEuler.
Este cambio asegura que las grandes matrices de pesos se procesen eficientemente en dispositivos OpenCL sin provocar cuellos de botella de rendimiento.