llama.cpp 项目发布了版本 b10355,引入了对多输出后端采样的支持。此更新启用了结合令牌推测的后端采样,并添加了数值上下文参数以声明每个序列的最大输出数。
- 启用带有令牌推测的后端采样
- 在将其转换为采样索引之前限制掩码总和
- 添加一个数值上下文参数,声明单个序列的最大输出数
- 修复 CPU 和后端采样之间的不匹配,并匹配 CPU 和 GPU 之间的分布 (dist)
- 简化更改并修复 Vulkan 上的测试
该版本为 macOS、iOS、Linux、Android、Windows 和 openEuler 提供了二进制文件,支持包括 CPU、CUDA、ROCm、OpenVINO、SYCL、HIP 和 Vulkan 在内的各种硬件后端。