Le projet llama.cpp a publié la version b10684, qui inclut une correction spécifique pour le backend SYCL afin que l'indicateur `--fit` respecte plus précisément `--fit-target`.
- L'algorithme `--fit` prend désormais en compte le VRAM de pic réel requis pour une taille de contexte donnée sur les backends SYCL.
- Cela empêche les erreurs de manque de mémoire en calculant correctement l'utilisation du VRAM lorsque le contexte alloué est entièrement utilisé.
- Il arrête également les calculs excessivement conservateurs qui réservaient auparavant trop de VRAM.
- Les tests sur un Arc b70 avec qwen3.8 d'unsloth (Q4_K_XL) ont démontré un contexte utilisable de 262144 avec KV et MTP en q8_0 utilisant `--fit-target 1`.
Ce changement permet aux utilisateurs d'utiliser des contextes plus grands sur du matériel SYCL sans manquer de mémoire, tout en évitant le gaspillage de VRAM réservé dû aux estimations conservatrices précédentes.