Проект llama.cpp выпустил версию b10684, которая включает конкретное исправление для бэкенда SYCL, чтобы флаг `--fit` более точно учитывал `--fit-target`.
- Алгоритм `--fit` теперь учитывает фактическое пиковое потребление VRAM, необходимое для заданного размера контекста на бэкендах SYCL.
- Это предотвращает ошибки переполнения памяти (out-of-memory) за счёт корректного расчёта использования VRAM при полном использовании выделенного контекста.
- Также устраняются излишне консервативные расчёты, которые ранее резервировали слишком много VRAM.
- Тестирование на Arc b70 с qwen3.8 от unsloth (Q4_K_XL) продемонстрировало возможность использования контекста размером 262144 с KV и MTP формата q8_0 при использовании `--fit-target 1`.
Это изменение позволяет пользователям использовать более длинные контексты на оборудовании SYCL без нехватки памяти, избегая при этом расточительства зарезервированного VRAM из-за предыдущих консервативных оценок.