← 返回 github llama.cpp · 19 小时前 · inference llama.cpp b11102 新增对 MiMo-V2.6 的支持 译自 English → 中文 llama.cpp 项目发布了构建版本 b11102,引入了对转换 MiMo-V2.6 模型的支持。 K3 mxfp4 转换重新打包被提升到 base.py 以启用复用。mmproj 转换过程中移除了解码器。转换逻辑现在使用自动解析器。二进制文件适用于 macOS、Linux、Windows、Android 和 openEuler,支持 CPU、GPU 和 NPU 后端。 重要性 1/3 可信度 1/3 llama.cpp Inference efficiency Local inference 阅读原文 相关文章 github llama.cpp · 刚刚 · 1 次浏览 实时 llama.cpp b11122 扩展 MMVQ GLU 融合并添加新的 SYCL 融合 llama.cpp 项目发布了版本 b11122,其中包括对 SYCL 后端的重大更新。该版本扩展了 MMVQ GLU 融合以支持混合量化类型,并为 rms_norm+scale 和 ssm_conv+silu 操作引入了新的融合。 github llama.cpp · 1 小时前 · 11 次浏览 实时 llama.cpp b11120 隐藏 Vulkan 内部符号以修复状态销毁问题 llama.cpp 项目发布了版本 b11120,通过隐藏内部符号解决了 Vulkan 后端中的一个关键错误。此更改防止了在导出内部符号时发生的重复 dlopen 状态销毁问题。 github llama.cpp · 6 小时前 · 13 次浏览 llama.cpp b11118 引入用于 HVX FA 掩码处理的直接映射 DMA 缓存 llama.cpp 项目已发布构建版本 b11118,其中包含一项新的 hex-dma 功能,引入了更适合 Hexagon Vector eXtended (HVX) FA 掩码处理的直接映射 DMA 缓存。 github llama.cpp · 17 小时前 · 9 次浏览 llama.cpp 为 HunyuanOCR 添加 DFlash 支持并修复草稿转换 llama.cpp 项目通过暴露目标图中的层输入张量,为 HunyuanOCR 模型添加了针对 DFlash 推测解码的支持。此更改使草稿模型能够读取残差流,从而使图像请求能够成功运行,其草稿接受率约为 0.5,且与非推测运行相比,OCR 输出字节完全一致。 github llama.cpp · 18 小时前 · 13 次浏览 llama.cpp b11104 增加了对将 llama-server 绑定到多个地址的支持 llama.cpp 项目发布了版本 b11104,引入了一项新功能,允许 llama-server 组件同时绑定到多个网络地址。
github llama.cpp · 刚刚 · 1 次浏览 实时 llama.cpp b11122 扩展 MMVQ GLU 融合并添加新的 SYCL 融合 llama.cpp 项目发布了版本 b11122,其中包括对 SYCL 后端的重大更新。该版本扩展了 MMVQ GLU 融合以支持混合量化类型,并为 rms_norm+scale 和 ssm_conv+silu 操作引入了新的融合。
github llama.cpp · 1 小时前 · 11 次浏览 实时 llama.cpp b11120 隐藏 Vulkan 内部符号以修复状态销毁问题 llama.cpp 项目发布了版本 b11120,通过隐藏内部符号解决了 Vulkan 后端中的一个关键错误。此更改防止了在导出内部符号时发生的重复 dlopen 状态销毁问题。
github llama.cpp · 6 小时前 · 13 次浏览 llama.cpp b11118 引入用于 HVX FA 掩码处理的直接映射 DMA 缓存 llama.cpp 项目已发布构建版本 b11118,其中包含一项新的 hex-dma 功能,引入了更适合 Hexagon Vector eXtended (HVX) FA 掩码处理的直接映射 DMA 缓存。
github llama.cpp · 17 小时前 · 9 次浏览 llama.cpp 为 HunyuanOCR 添加 DFlash 支持并修复草稿转换 llama.cpp 项目通过暴露目标图中的层输入张量,为 HunyuanOCR 模型添加了针对 DFlash 推测解码的支持。此更改使草稿模型能够读取残差流,从而使图像请求能够成功运行,其草稿接受率约为 0.5,且与非推测运行相比,OCR 输出字节完全一致。
github llama.cpp · 18 小时前 · 13 次浏览 llama.cpp b11104 增加了对将 llama-server 绑定到多个地址的支持 llama.cpp 项目发布了版本 b11104,引入了一项新功能,允许 llama-server 组件同时绑定到多个网络地址。