llama.cpp 服务器现在支持 /v1/embeddings 端点的类型化内容(视觉、音频、视频)输入。此更新通过接受 OpenAI 风格的包装内容数组,使多模态嵌入请求成为可能,允许文本和 image_url 部分一起处理。
- 接受用于多模态嵌入的 OpenAI 风格包装内容数组格式。
- 文本部分被连接,而 image_url 部分通过 handle_media 解码并与 process_mtmd_prompt 拼接。
- 遗留格式(纯字符串、token 数组、混合数组)继续按原样工作。
- 裸内容数组将被拒绝并显示迁移消息。
- 禁用无状态嵌入/重排序任务的 KV 前缀重用,以防止跨请求的错误缓存共享。
此更改允许用户使用标准 OpenAI API 格式为多模态输入生成嵌入,同时确保重复输入不会错误地共享缓存的键值对。