Proyek llama.cpp merilis versi b10906, yang mencakup perbaikan untuk komponen server terkait decoding spekulatif setelah input gambar. Perubahan ini memastikan bahwa posisi aktual dilewatkan ke drafter alih-alih jumlah token, memengaruhi semua drafter dan bukan hanya DFlash.
- Parameter draft `n_past` diubah namanya menjadi `pos0` untuk secara akurat mencerminkan perannya sebagai penunjuk posisi daripada jumlah token.
- Menyediakan biner pra-bangun untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.
Pembaruan ini memperbaiki inkonsistensi nama parameter dan memastikan penanganan posisi yang tepat dalam logika decoding spekulatif server.