llama.cpp プロジェクトはバージョン b10210 をリリースしました。これには、ドラフトトークンの再生が必要な場合に受け入れられたトークンを処理するためのサーバーロジックの修正が含まれています。
- ドラフトトークンの再生が必要な場合、サーバーコンポーネント内の受け入れられたトークンを修正します。
- macOS (Apple Silicon および Intel)、iOS、Linux (Ubuntu x64/arm64/s390x with CPU, Vulkan, ROCm, OpenVINO, SYCL)、Android、Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP)、および openEuler 用のビルド済みバイナリを提供します。
- UI リリースパッケージが含まれています。
このアップデートにより、サポートされているすべてのプラットフォームでの推論デコーディングシナリオにおけるトークンの正確な処理が保証されます。