El proyecto llama.cpp ha lanzado la versión b10210, que incluye una corrección a la lógica del servidor para manejar los tokens aceptados cuando se requiere la repetición de tokens borrador.

  • Corrige los tokens aceptados en el componente del servidor cuando se necesita la repetición de tokens borrador.
  • Proporciona binarios precompilados para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64/arm64/s390x con CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) y openEuler.
  • Incluye un paquete de lanzamiento con interfaz de usuario.

Esta actualización asegura un manejo preciso de los tokens en escenarios de decodificación especulativa en todas las plataformas compatibles.