llama.cpp 项目发布了构建版本 b10273,解决了一个关键问题:由于后端采样限制,基于历史的采样器在初始化期间无法推断正确的上下文长度。

  • 将采样器的 ctx-len 从 -1 修正为 1024,以修复初始化错误。
  • 为基于历史的采样器设置共享默认值 64,并移除 context_size 参数。
  • 提供适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,支持 CPU、GPU(CUDA、Vulkan、ROCm、SYCL)以及 OpenVINO 后端。

此更新确保在 llama_context 完整对象尚不可用的早期构建阶段,采样器行为保持稳定。