Проект llama.cpp выпустил версию b10327, которая включает исправление количества потоков и блоков при запуске ядра копирования с квантованием на CUDA. Это обновление устраняет проблему, выявленную в pull request #26731.
- В релиз добавлены тесты для случаев копирования с неравномерным количеством блоков, чтобы обеспечить корректность.
- Бинарные файлы доступны для macOS (Apple Silicon и Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) и openEuler.
- Также предоставляется iOS XCFramework и автономная сборка UI.
Этот релиз обеспечивает стабильное выполнение операций копирования с квантованием на оборудовании CUDA в широком диапазоне поддерживаемых платформ.