O projeto llama.cpp lançou a versão b10538, introduzindo uma otimização-chave no backend metal. Esta atualização permite a desquantização do cache de chave-valor (KV) exclusivamente para tamanhos de lote grandes.
- A principal mudança está no backend metal, que agora aplica o cache KV desquantizado apenas ao processar grandes lotes.
- Os binários estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
O suporte ao KleidiAI no Apple Silicon para macOS e o ROCm 7.14 no Ubuntu estão desabilitados neste lançamento.
Esta otimização visa melhorar a eficiência de memória ou o desempenho para cargas de trabalho que envolvem grandes tamanhos de lote em hardware compatível.