O projeto llama.cpp lançou a compilação b11025, que inclui uma extensão do suporte à Predição Multi-Token (MTP) da Nemotron.
- A atualização aborda a primeira correção para este recurso e remove declarações desnecessárias.
- Binários estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.
- Uma compilação de UI independente também está disponível para download.