Проект llama.cpp выпустил сборку b10273, решающую критическую проблему, при которой исторические сэмплеры не могли определить правильную длину контекста во время инициализации из-за ограничений бэкенда для выборки.

  • Исправляет значение -1 на 1024 вместо ctx-len для сэмплеров, чтобы устранить ошибки инициализации.
  • Устанавливает общее значение по умолчанию 64 для исторических сэмплеров и удаляет параметр context_size.
  • Предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для CPU, GPU (CUDA, Vulkan, ROCm, SYCL) и бэкендов OpenVINO.

Это обновление обеспечивает стабильную работу сэмплеров на ранних этапах построения, когда полный объект llama_context ещё недоступен.