Le projet llama.cpp a publié la version b10210, qui inclut une correction de la logique du serveur pour gérer les tokens acceptés lorsque la relecture des tokens de brouillon est nécessaire.
- Corrige les tokens acceptés dans le composant serveur lorsque la relecture des tokens de brouillon est nécessaire.
- Fournit des binaires précompilés pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu x64/arm64/s390x with CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) et openEuler.
- Inclut un package de release avec interface utilisateur.
Cette mise à jour garantit une gestion précise des tokens dans les scénarios de décodage spéculatif sur toutes les plateformes prises en charge.