llama.cpp 项目发布了构建版本 b11368,引入了用于简单草稿和 MTP(Multi-Token Prediction)工作流 probabilistic sampling。此更新修改了草稿机制,以使用概率选择并通过拒绝采样验证目标。
- 草稿生成器现在使用概率采样,目标验证由拒绝采样处理。
- 在草稿过程开始之前丢弃过期的 spec_draft_q 缓冲区。
- 语法约束请求现在支持拒绝采样并回退到 argmax 采样。
- 新标志启用概率草稿采样,默认为贪婪行为。
- 草稿采样器不再共享目标 RNG 流,掩码后分布会重新归一化。
此版本为 macOS、Linux、Windows、Android 和 openEuler 提供二进制文件,支持包括 CUDA、ROCm、Vulkan、OpenVINO 和 SYCL 在内的各种硬件后端。