O projeto llama.cpp lançou a versão b10412, que introduz suporte à amostragem de backend tanto para os backends dflash quanto dspark. Esta atualização também permite valores p_min maiores que 0 dentro da lógica de amostragem de backend e adiciona as salvaguardas correspondentes.

  • Habilita a amostragem de backend para dflash e dspark.
  • Permite p_min > 0 na amostragem de backend com proteções adicionais.
  • Fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, OpenVINO, SYCL), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.

Este lançamento expande as opções de aceleração por hardware disponíveis para os usuários do llama.cpp.