Проект llama.cpp выпустил версию b10684, которая включает конкретное исправление для бэкенда SYCL, чтобы флаг `--fit` более точно учитывал `--fit-target`.

  • Алгоритм `--fit` теперь учитывает фактическое пиковое потребление VRAM, необходимое для заданного размера контекста на бэкендах SYCL.
  • Это предотвращает ошибки переполнения памяти (out-of-memory) за счёт корректного расчёта использования VRAM при полном использовании выделенного контекста.
  • Также устраняются излишне консервативные расчёты, которые ранее резервировали слишком много VRAM.
  • Тестирование на Arc b70 с qwen3.8 от unsloth (Q4_K_XL) продемонстрировало возможность использования контекста размером 262144 с KV и MTP формата q8_0 при использовании `--fit-target 1`.

Это изменение позволяет пользователям использовать более длинные контексты на оборудовании SYCL без нехватки памяти, избегая при этом расточительства зарезервированного VRAM из-за предыдущих консервативных оценок.