O projeto llama.cpp lançou a compilação b10198, que introduz suporte para operações de concatenação quantizada dentro do backend Vulkan.

  • A principal atualização técnica é a adição de suporte Vulkan para concat quantizado, implementada no pull request #25684.
  • As compilações do macOS Apple Silicon com KleidiAI estão explicitamente desativadas nesta versão.
  • Binários são fornecidos para várias plataformas, incluindo macOS (Apple Silicon e Intel), Linux (Ubuntu x64, arm64, s390x), Windows (CPU, CUDA 12/13, Vulkan, ROCm, OpenVINO, SYCL, HIP), Android e openEuler.
  • Um binário de UI standalone também está incluído no pacote de lançamento.