Проект llama.cpp выпустил сборку b11306, которая устраняет сбой, вызванный изменением формы графа во время декодирования. Обновление изменяет обработку флага `causal_attn`, чтобы предотвратить сбои перераспределения при определённых ограничениях планирования.

  • После декодирования на устройстве `causal_attn` отключается для половины ubatch, а затем снова включается для оставшейся части, чтобы обеспечить согласованное количество узлов.
  • Это изменение предотвращает перераспределение графа при неизменном размере, что ранее приводило к прерыванию выполнения при активном `GGML_SCHED_NO_REALLOC`.
  • Исправление применяется к архитектурам декодирования, но пропускается для архитектур кодирования.

Релиз включает бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0) и openEuler.