O projeto llama.cpp lançou a versão b10412, que introduz suporte à amostragem de backend tanto para os backends dflash quanto dspark. Esta atualização também permite valores p_min maiores que 0 dentro da lógica de amostragem de backend e adiciona as salvaguardas correspondentes.
- Habilita a amostragem de backend para dflash e dspark.
- Permite p_min > 0 na amostragem de backend com proteções adicionais.
- Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.
Este lançamento expande as opções de aceleração por hardware disponíveis para os usuários do llama.cpp.