O projeto llama.cpp lançou a versão b10327, que inclui uma correção para a contagem de threads e blocos nos lançamentos do kernel de cópia quantizada no CUDA. Esta atualização aborda um problema identificado no pull request #26731.

  • O lançamento adiciona testes para casos de cópia com contagem de blocos desigual para garantir a correção.
  • Os binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e openEuler.
  • Um XCFramework para iOS e uma compilação de UI independente também são fornecidos.

Este lançamento garante a execução estável de operações de cópia quantizada em hardware CUDA em uma ampla gama de plataformas suportadas.