llama.cpp 项目发布了构建版本 b10653,在其模型加载器中引入了 TENSOR_READ_LAZY 功能。此更改包括添加 TENSOR_GET_ROW_LAZY 函数以及相应的命令行标志 --tensor-read-lazy。

  • 向模型加载器添加了 TENSOR_READ_LAZY 和 TENSOR_GET_ROW_LAZY。
  • 引入 CLI 选项 --tensor-read-lazy 以启用惰性张量读取。
  • 提供适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 iOS 的二进制文件。

此版本使用新的惰性加载功能更新了核心库,并在支持的平台上分发预构建的二进制文件。