O projeto llama.cpp lançou a versão b10246, que inclui uma correção para o desempenho do OpenCL em configurações específicas de modelos. A atualização aborda um problema onde a condição de dimensão original era insuficiente para lidar com grandes pesos.
- Roteia tensores lm_head q6_K grandes para GEMV plano em vez de gemv_noshuffle.
- Adiciona uma condição de tamanho direta para evitar lentidão com modelos como gemma-4 E2B, que tem dimensões [1536, 262144].
- Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) e openEuler.
Esta alteração garante que grandes matrizes de pesos sejam processadas eficientemente em dispositivos OpenCL sem causar gargalos de desempenho.