llama.cpp 项目发布了构建版本 b10447,其中包括对 `yield_to_queue` 线程模型的重新设计。此更改涉及在 worker 中运行 `common_speculative_process` 并交换 worker 到主线程的设计。

该发布版为 macOS(Apple Silicon 和 Intel)、Linux(Ubuntu 带 CPU、Vulkan、OpenVINO、SYCL 及禁用的 ROCm)、Android、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL 及 ROCm 7.14)和 openEuler(部分构建已禁用)提供了二进制文件。

此更新可在所有支持的平台上下载。