Proyek llama.cpp merilis build b10148, mengatasi masalah dengan konfigurasi decoding spekulatif dan logging. Pembaruan memastikan bahwa argumen baris perintah eksplisit untuk model draft memiliki prioritas atas resolusi sidecar otomatis.
- Flag --model-draft eksplisit sekarang menonaktifkan resolusi sidecar otomatis, memungkinkan konfigurasi CLI manual menimpa perilaku default.
- Logika pemilihan sidecar diperbarui untuk berakar pada tag model utama, memungkinkan kecocokan tepat atau fallback kuantisasi terdekat.
- Log pemuatan spekulatif dipromosikan dari level trace ke info, membuat visibilitas konteks model draft dan MTP konsisten dengan log sistem lainnya.
Perubahan ini meningkatkan keandalan bagi pengguna yang mengandalkan spesifikasi model draft manual dan menyediakan logging operasional yang lebih jelas.