llama.cpp 项目发布了构建版本 b10712,引入了一个新的用于 Vulkan 的 top-k radix sort 着色器,旨在支持大于或等于 1024 的 k 值。此更新专门针对 Qwen 3.8 Flash Next 模型,并包含相应的测试以及 top-k qsa 融合。
- 在 Vulkan 后端添加了适用于 k >= 1024 的 top-k radix sort 着色器。
- 包含 Qwen 3.8 Flash Next 的 top-k 测试以验证新功能。
- 实现了 top-k qsa 融合并进行了代码清理。
此版本为 macOS、Linux、Windows、Android 和 iOS 提供了二进制文件,支持 CPU、GPU(CUDA、ROCm、OpenCL、SYCL)以及 AI 专用后端(OpenVINO、KleidiAI)。