O projeto llama.cpp lançou a versão b10210, que inclui uma correção na lógica do servidor para lidar com tokens aceitos quando a repetição de tokens rascunho é necessária.
- Corrige os tokens aceitos no componente do servidor quando a repetição de tokens rascunho é necessária.
- Fornece binários pré-compilados para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64/arm64/s390x com CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e openEuler.
- Inclui um pacote de lançamento com interface gráfica.
Esta atualização garante o manuseio preciso de tokens em cenários de decodificação especulativa em todas as plataformas suportadas.