Proyek llama.cpp merilis build b10896, yang mengatasi masalah kritis di mana memori drafter gagal mengalokasikan token baru saat menggunakan DFlash dengan model visi. Kegagalan ini terjadi karena gambar melaporkan offset tetap, mencegah alokasi token yang tepat.

  • Perbaikan menghentikan penyalinan offset gambar agar drafter dapat melanjutkan dekoding.
  • Lompatan M-RoPE dibatasi hanya untuk gambar, memungkinkan audio melewati tanpa perubahan.
  • Komentar dibersihkan agar sesuai dengan logika implementasi yang diperbarui.

Pembaruan ini memastikan bahwa dekoding spekulatif dengan DFlash berfungsi dengan benar untuk model multimodal dengan menyelesaikan kesalahan alokasi memori yang disebabkan oleh penanganan metadata gambar.