O projeto llama.cpp lançou a versão b10539, que aborda um problema crítico de estabilidade numérica no backend do Vulkan enquanto expande o suporte de hardware para usuários do Windows.
- Vulkan FA MMQ agora usa fp32 para cálculos de quantização Q para evitar estouro quando qd é um denorm.
- Adicionados binários para Windows x64 para CUDA 13 e suporte preview para Windows arm64 com CUDA 13.4.
- Inclui builds para Ubuntu s390x (CPU), macOS Intel (x64) e iOS XCFramework.
- O suporte ao OpenCL Adreno agora está disponível para Windows arm64.
Esta atualização garante desempenho confiável em dispositivos Vulkan, prevenindo erros aritméticos, e fornece aos usuários as últimas opções de compatibilidade com CUDA 13.