O projeto llama.cpp lançou a versão b10327, que inclui uma correção para a contagem de threads e blocos nos lançamentos do kernel de cópia quantizada no CUDA. Esta atualização aborda um problema identificado no pull request #26731.
- O lançamento adiciona testes para casos de cópia com contagem de blocos desigual para garantir a correção.
- Os binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e openEuler.
- Um XCFramework para iOS e uma compilação de UI independente também são fornecidos.
Este lançamento garante a execução estável de operações de cópia quantizada em hardware CUDA em uma ampla gama de plataformas suportadas.