Proyek llama.cpp merilis versi b11440, yang mencakup perbaikan untuk inisialisasi MTP spekulatif. Pembaruan memastikan penjadwal dipesan ulang ketika flag ekstraksi NextN berubah, mencegah masalah dengan ekstraksi tanpa masker.
- Inisialisasi MTP spekulatif sekarang mengaktifkan ekstraksi NextN pada konteks target dan draf setelah pembuatan.
- Grafik trunk menyimpan setiap token hingga lapisan terakhir alih-alih memotong ke baris output.
- Meminvalidasi reservasi ketika flag berubah memungkinkan komputasi berikutnya memesan ulang dengan bentuk grafik baru.
- Binari tersedia untuk macOS, Linux, Windows, Android, dan iOS melalui backend CPU, GPU, dan NPU.
Perubahan ini mencegah kesalahan GGML_SCHED_DEBUG_REALLOC dengan memastikan alokasi bentuk batch yang benar selama dekoding.