El proyecto llama.cpp ha lanzado la versión b10210, que incluye una corrección a la lógica del servidor para manejar los tokens aceptados cuando se requiere la repetición de tokens borrador.
- Corrige los tokens aceptados en el componente del servidor cuando se necesita la repetición de tokens borrador.
- Proporciona binarios precompilados para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64/arm64/s390x con CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) y openEuler.
- Incluye un paquete de lanzamiento con interfaz de usuario.
Esta actualización asegura un manejo preciso de los tokens en escenarios de decodificación especulativa en todas las plataformas compatibles.