llama.cpp プロジェクトはバージョン b10210 をリリースしました。これには、ドラフトトークンの再生が必要な場合に受け入れられたトークンを処理するためのサーバーロジックの修正が含まれています。

  • ドラフトトークンの再生が必要な場合、サーバーコンポーネント内の受け入れられたトークンを修正します。
  • macOS (Apple Silicon および Intel)、iOS、Linux (Ubuntu x64/arm64/s390x with CPU, Vulkan, ROCm, OpenVINO, SYCL)、Android、Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP)、および openEuler 用のビルド済みバイナリを提供します。
  • UI リリースパッケージが含まれています。

このアップデートにより、サポートされているすべてのプラットフォームでの推論デコーディングシナリオにおけるトークンの正確な処理が保証されます。