O projeto llama.cpp lançou a versão b10539, que aborda um problema crítico de estabilidade numérica no backend do Vulkan enquanto expande o suporte de hardware para usuários do Windows.

  • Vulkan FA MMQ agora usa fp32 para cálculos de quantização Q para evitar estouro quando qd é um denorm.
  • Adicionados binários para Windows x64 para CUDA 13 e suporte preview para Windows arm64 com CUDA 13.4.
  • Inclui builds para Ubuntu s390x (CPU), macOS Intel (x64) e iOS XCFramework.
  • O suporte ao OpenCL Adreno agora está disponível para Windows arm64.

Esta atualização garante desempenho confiável em dispositivos Vulkan, prevenindo erros aritméticos, e fornece aos usuários as últimas opções de compatibilidade com CUDA 13.