llama.cpp 项目已添加对 embeddingGemma2 模型的支持,该模型处理文本、视觉和音频输入。此更新通过 pull request #30054 实现。
github
llama.cpp
·
5 小时前
·
inference
llama.cpp 添加对 embeddingGemma2 多模态嵌入的支持
译自 English → 中文
相关文章
github
llama.cpp
·
1 天前
·
27 次浏览
llama.cpp v0.6.0 添加扩展批处理 API、GLM-5.3-Flash 支持及决策模型端点
llama.cpp v0.6.0 引入了新的 llama_batch_ext 扩展批处理 API,用于混合 token 和嵌入输入,同时支持 GLM-5.3-Flash 320B 混合模型和 Clef 决策模型。
github
llama.cpp
·
8 天前
·
45 次浏览
llama.cpp b11240 为 /v1/embeddings 添加类型化多模态输入支持
llama.cpp 服务器现在支持 /v1/embeddings 端点的类型化内容(视觉、音频、视频)输入。此更新通过接受 OpenAI 风格的包装内容数组,使多模态嵌入请求成为可能,允许文本和 image_url 部分一起处理。
media
MarkTechPost
·
11 天前
·
46 次浏览
Liquid AI 发布 LFM2.5-VL-3B-DSpark 推测草稿模型,解码速度最高提升 3.13 倍
Liquid AI 发布了 LFM2.5-VL-3B-DSpark,这是为其 LFM2.5-VL-3B 视觉语言模型设计的实验性推测解码草稿模型。该草稿模型增加了约 280M 参数,在不改变模型输出分布的情况下加速了 token 生成。
lab
Hugging Face Blog
·
12 天前
·
38 次浏览
Liquid AI 发布 LFM2.5-VL-DSpark 以加速视觉语言模型推理
Liquid AI 发布了 LFM2.5-VL-DSpark 草稿模型,这是一种推测解码的草稿生成器,旨在加速 LFM2.5-VL-3B 视觉语言模型的推理。该草稿生成器从目标模型的固定层捕获隐藏状态以生成候选 token,仅增加 280M 参数(开销为 8.9%),同时保持跨模态的维度一致。
lab
Liquid AI
·
12 天前
·
40 次浏览
Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 草稿模型
Liquid AI 发布了其视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,能够在不改变输出质量的情况下加速边缘设备和 GPU 上的解码。