llama.cpp 项目发布了版本 b10355,引入了对多输出后端采样的支持。此更新启用了结合令牌推测的后端采样,并添加了数值上下文参数以声明每个序列的最大输出数。

  • 启用带有令牌推测的后端采样
  • 在将其转换为采样索引之前限制掩码总和
  • 添加一个数值上下文参数,声明单个序列的最大输出数
  • 修复 CPU 和后端采样之间的不匹配,并匹配 CPU 和 GPU 之间的分布 (dist)
  • 简化更改并修复 Vulkan 上的测试

该版本为 macOS、iOS、Linux、Android、Windows 和 openEuler 提供了二进制文件,支持包括 CPU、CUDA、ROCm、OpenVINO、SYCL、HIP 和 Vulkan 在内的各种硬件后端。