Proyek llama.cpp telah merilis versi b10210, yang mencakup koreksi pada logika server untuk menangani token yang diterima ketika replikasi token draf diperlukan.

  • Memperbaiki token yang diterima di komponen server ketika replikasi token draf diperlukan.
  • Menyediakan binaris pra-bangun untuk macOS (Apple Silicon dan Intel), iOS, Linux (Ubuntu x64/arm64/s390x with CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP), dan openEuler.
  • Termasuk paket rilis UI.

Pembaruan ini memastikan penanganan token yang akurat dalam skenario decoding spekulatif di semua platform yang didukung.