← 返回 media r/LocalLLaMA · 1 小时前 · open_models G9v3-39A5B MoE模型在artificialanalysis上表现强劲 译自 English → 中文 G9v3-39A5B模型因其performance在artificialanalysis上的表现而受到关注,据报道其排名高于Qwen 3.6 27B。 它是一种混合专家(MoE)架构。存在一个llama.cpp的功能分支以支持G9v3格式。GGUF检查点可通过Hugging Face获取。 重要性 2/3 r/LocalLLaMA Inference efficiency Local inference 阅读原文 相关文章 media Hugging Face Forums · 1 小时前 · 1 次浏览 实时 Celestium 管道通过自适应 FP16 和 CPU 回退使 SDXL 在 4GB-8GB GPU 上运行 使用 Celestium 的硬件无关推理管道进行的诊断表明,Stable Diffusion XL 可以通过利用自适应 FP16 精度和自主内存清理,在低显存 GPU(4GB、6GB 和 8GB)上稳定运行。该方法防止了多阶段管道期间的碎片化峰值,并利用紧急 CPU 模式在 GPU 显存耗尽时维持生成。 github llama.cpp · 11 小时前 · 1 次浏览 llama.cpp b10505 新增 dedup-cache-models 预设选项 llama.cpp 项目发布了 b10505 版本,为服务器组件引入了新的 `dedup-cache-models` 预设选项。 media Hugging Face Forums · 2 天前 · 3 次浏览 傅里叶幅度KV缓存量化在相同内存下使上下文长度翻倍 ntrillard 证明,将 K 和 V 缓存值的傅里叶幅度谱量化为 4 位,同时以全精度保留相位,在 Gemma-3-1B 上相对于 fp16 参考实现了 96.9% 的 token 匹配率,相比标准 min-max 量化提升了 5-10 倍。 github llama.cpp · 5 天前 · 26 次浏览 llama.cpp 新增对 Kimi-K3 模型的支持,包含 MXFP4 重新打包和聊天模板 llama.cpp 项目已添加对 Kimi-K3 文本模型的支持,实现了其混合 KDA(线性)+ MLA(全量)注意力架构,以及旧版 Kimi-Linear-48B 中不具备的五项特定架构特性。 github llama.cpp · 5 天前 · 21 次浏览 llama.cpp b10447 重新设计了 yield_to_queue 线程模型 llama.cpp 项目发布了构建版本 b10447,其中包括对 `yield_to_queue` 线程模型的重新设计。此更改涉及在 worker 中运行 `common_speculative_process` 并交换 worker 到主线程的设计。
media Hugging Face Forums · 1 小时前 · 1 次浏览 实时 Celestium 管道通过自适应 FP16 和 CPU 回退使 SDXL 在 4GB-8GB GPU 上运行 使用 Celestium 的硬件无关推理管道进行的诊断表明,Stable Diffusion XL 可以通过利用自适应 FP16 精度和自主内存清理,在低显存 GPU(4GB、6GB 和 8GB)上稳定运行。该方法防止了多阶段管道期间的碎片化峰值,并利用紧急 CPU 模式在 GPU 显存耗尽时维持生成。
github llama.cpp · 11 小时前 · 1 次浏览 llama.cpp b10505 新增 dedup-cache-models 预设选项 llama.cpp 项目发布了 b10505 版本,为服务器组件引入了新的 `dedup-cache-models` 预设选项。
media Hugging Face Forums · 2 天前 · 3 次浏览 傅里叶幅度KV缓存量化在相同内存下使上下文长度翻倍 ntrillard 证明,将 K 和 V 缓存值的傅里叶幅度谱量化为 4 位,同时以全精度保留相位,在 Gemma-3-1B 上相对于 fp16 参考实现了 96.9% 的 token 匹配率,相比标准 min-max 量化提升了 5-10 倍。
github llama.cpp · 5 天前 · 26 次浏览 llama.cpp 新增对 Kimi-K3 模型的支持,包含 MXFP4 重新打包和聊天模板 llama.cpp 项目已添加对 Kimi-K3 文本模型的支持,实现了其混合 KDA(线性)+ MLA(全量)注意力架构,以及旧版 Kimi-Linear-48B 中不具备的五项特定架构特性。
github llama.cpp · 5 天前 · 21 次浏览 llama.cpp b10447 重新设计了 yield_to_queue 线程模型 llama.cpp 项目发布了构建版本 b10447,其中包括对 `yield_to_queue` 线程模型的重新设计。此更改涉及在 worker 中运行 `common_speculative_process` 并交换 worker 到主线程的设计。