Проект llama.cpp выпустил версию b10539, которая устраняет критическую проблему численной стабильности в бэкенде Vulkan, одновременно расширяя поддержку оборудования для пользователей Windows.
- Vulkan FA MMQ теперь использует fp32 для вычислений квантования Q, чтобы предотвратить переполнение, когда qd является денормализованным числом.
- Добавлены бинарные файлы для Windows x64 для CUDA 13 и предварительная поддержка Windows arm64 с CUDA 13.4.
- Включены сборки для Ubuntu s390x (CPU), macOS Intel (x64) и iOS XCFramework.
- Поддержка OpenCL Adreno теперь доступна для Windows arm64.
Это обновление обеспечивает надежную производительность на устройствах Vulkan, предотвращая арифметические ошибки, и предоставляет пользователям последние варианты совместимости с CUDA 13.