Проект llama.cpp выпустил версию b10210, которая включает исправление логики сервера для обработки принятых токенов при необходимости повторного воспроизведения черновых токенов.

  • Исправляет принятые токены в компоненте сервера при необходимости повторного воспроизведения черновых токенов.
  • Предоставляет предварительно собранные бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (Ubuntu x64/arm64/s390x с CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) и openEuler.
  • Включает пакет с графическим интерфейсом пользователя.

Это обновление обеспечивает точную обработку токенов в сценариях спекулятивного декодирования на всех поддерживаемых платформах.