Проект llama.cpp выпустил версию b10327, которая включает исправление количества потоков и блоков при запуске ядра копирования с квантованием на CUDA. Это обновление устраняет проблему, выявленную в pull request #26731.

  • В релиз добавлены тесты для случаев копирования с неравномерным количеством блоков, чтобы обеспечить корректность.
  • Бинарные файлы доступны для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) и openEuler.
  • Также предоставляется iOS XCFramework и автономная сборка UI.

Этот релиз обеспечивает стабильное выполнение операций копирования с квантованием на оборудовании CUDA в широком диапазоне поддерживаемых платформ.