O projeto llama.cpp lançou a compilação b10727, que introduz suporte à concatenação para tipos de dados quantizados. Esta atualização é assistida pelo DeepSeek-V4-Flash-0731 e inclui binários para macOS, Linux, Windows, Android e openEuler em vários backends de hardware, incluindo CPU, CUDA, ROCm e Vulkan.
A versão fornece binários pré-compilados para múltiplas plataformas e arquiteturas:
- macOS Apple Silicon (arm64) e Intel (x64)
- iOS via XCFramework
- Distribuições Linux incluindo Ubuntu x64, arm64, s390x e variantes com suporte a Vulkan, ROCm 7.14, OpenVINO e SYCL
- Windows x64 e arm64 com opções de CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm 7.14
- Android arm64 (CPU)
- Configurações openEuler x86 e aarch64
Esta versão permite que os usuários utilizem a nova funcionalidade de concat quantizada em uma ampla gama de sistemas operacionais e aceleradores de hardware suportados.