Proyek llama.cpp merilis versi b10684, yang mencakup perbaikan khusus untuk backend SYCL agar flag `--fit` lebih akurat menghormati `--fit-target`.
- Algoritma `--fit` sekarang memperhitungkan VRAM puncak aktual yang diperlukan untuk ukuran konteks tertentu pada backend SYCL.
- Ini mencegah kesalahan kehabisan memori dengan menghitung penggunaan VRAM secara tepat ketika konteks yang dialokasikan digunakan sepenuhnya.
- Ini juga menghentikan perhitungan yang terlalu konservatif yang sebelumnya memesan terlalu banyak VRAM.
- Pengujian pada Arc b70 dengan qwen3.8 dari unsloth (Q4_K_XL) menunjukkan konteks yang dapat digunakan sebesar 262144 dengan KV dan MTP di q8_0 menggunakan `--fit-target 1`.
Perubahan ini memungkinkan pengguna memanfaatkan konteks yang lebih besar pada perangkat keras SYCL tanpa kehabisan memori, sambil menghindari pemborosan VRAM yang dipesan dari perkiraan konservatif sebelumnya.