Proyek llama.cpp merilis build b10584, mengatasi masalah kritis di mana ukuran konteks draf tidak sesuai dengan konteks target, menyebabkan permintaan server gagal dengan kesalahan 500.
- Server sekarang memastikan bahwa konteks draf mengikuti ukuran konteks target, mencegah kegagalan dekoding ketika slot diisi melebihi batas sebelumnya.
- Reservas memori untuk model draf diukur pada konteks terbesar yang dapat diambil oleh target, memungkinkan konteks yang berbagi sel dengan target untuk menghapus kv_size override.
- Fungsi fit sekarang memperhitungkan model kedua opsional, memastikan memorinya diukur setiap kali konteks utama berubah untuk menjaga jalur reduce tetap tepat.
Pembaruan ini menyelesaikan masalah stabilitas dalam penyiapan server dengan menyelaraskan ukuran konteks draf dan target secara dinamis.