llama.cpp 项目发布了版本 b10199,为其服务器组件引入了新功能。主要更新使服务器能够支持用于生成下一个 token 的嵌入,具体增加了对于采样 token 嵌入的支持。
- 服务器现在支持为采样 token 生成嵌入,以辅助下一个 token 预测工作流。
- 对 ~server_batch() 析构函数应用了修复。
- 此版本中禁用了带有 KleidiAI 的 macOS Apple Silicon (arm64) 构建。
- 预编译二进制文件适用于 Linux、Windows、Android 和 macOS,支持 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 和 OpenCL 后端。
此更新允许利用 llama.cpp 服务器的用户直接在生成过程中访问 token 嵌入,这对于需要输出 token 向量表示的应用程序非常有用。