Proyek llama.cpp merilis versi b11440, yang mencakup perbaikan untuk inisialisasi MTP spekulatif. Pembaruan memastikan penjadwal dipesan ulang ketika flag ekstraksi NextN berubah, mencegah masalah dengan ekstraksi tanpa masker.

  • Inisialisasi MTP spekulatif sekarang mengaktifkan ekstraksi NextN pada konteks target dan draf setelah pembuatan.
  • Grafik trunk menyimpan setiap token hingga lapisan terakhir alih-alih memotong ke baris output.
  • Meminvalidasi reservasi ketika flag berubah memungkinkan komputasi berikutnya memesan ulang dengan bentuk grafik baru.
  • Binari tersedia untuk macOS, Linux, Windows, Android, dan iOS melalui backend CPU, GPU, dan NPU.

Perubahan ini mencegah kesalahan GGML_SCHED_DEBUG_REALLOC dengan memastikan alokasi bentuk batch yang benar selama dekoding.