Проект llama.cpp выпустил версию b10539, которая устраняет критическую проблему численной стабильности в бэкенде Vulkan, одновременно расширяя поддержку оборудования для пользователей Windows.

  • Vulkan FA MMQ теперь использует fp32 для вычислений квантования Q, чтобы предотвратить переполнение, когда qd является денормализованным числом.
  • Добавлены бинарные файлы для Windows x64 для CUDA 13 и предварительная поддержка Windows arm64 с CUDA 13.4.
  • Включены сборки для Ubuntu s390x (CPU), macOS Intel (x64) и iOS XCFramework.
  • Поддержка OpenCL Adreno теперь доступна для Windows arm64.

Это обновление обеспечивает надежную производительность на устройствах Vulkan, предотвращая арифметические ошибки, и предоставляет пользователям последние варианты совместимости с CUDA 13.